LLM Performance on a Real, Double-Marked GCSE Benchmark
Researchers introduced a dataset of 32,534 double-marked GCSE student responses and tested large language models (LLMs) against examiner consensus. Top-performing LLMs agreed more closely with examiners than examiners ag…