06:51
2026-08-11
research.nvidia.com
artificial-intelligence
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
Researchers introduced RefineBench, a benchmark of 1,000 challenging problems across 11 domains, to evaluate language models' ability to refine their own responses. In self-refinement, even frontier mโฆ