04:00
2026-09-03
arxiv.org
artificial-intelligence
EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models
Researchers introduced EvalDetectBench, an open pipeline and benchmark for measuring evaluation awareness in frontier large language models, which can undermine the validity of AI safety evaluations iā¦