04:00
2026-07-24
arxiv.org
large-language-models
Benchmarking the Personalization Capabilities of Large Language Models
A new benchmark, SDR-Bench, reveals that frontier large language models and deep-research agents plateau in personalization, failing to statistically separate successful from unsuccessful outreach in โฆ