04:00
2026-09-28
arxiv.org
large-language-models
A Benchmark Framework for Screening Automation in Systematic Reviews
A new arXiv paper (2609.30298v1) introduces SRBench, a benchmark dataset of 45,064 labeled entries drawn from 32 curated secondary studies, for evaluating large language model performance in systemati…