14:00
2026-07-14
lesswrong.com
artificial-intelligence
Enough is Enough: Measuring Diminishing returns to benchmark size with Item Response Theory
A new analysis using Item Response Theory (IRT) finds that adding more questions to LLM benchmarks like Omni-MATH yields diminishing returns in measurement precision, because questions on similar topiβ¦