04:00
2026-09-24
arxiv.org
ai-research
What Makes a Terminal-Bench Task Hard? Separating Genuine Hardness from Fake-Hardness on an Adjudicated Agentic Corpus
An analysis of a frozen Terminal-Bench 3 / Frontier-Bench 0.1 production record covering 1,081 pull requests, 639 scored tasks, 28,801 trials and $105,933 in logged agent spend found that only 78 of 1…