04:00
2026-07-22
arxiv.org
large-language-models
FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis
Researchers introduce FindStatBench, an execution benchmark for evaluating large language models on combinatorial code synthesis, containing 2,329 tasks across 24 collections and 5.52 million hidden iโฆ