04:00
2026-08-14
arxiv.org
artificial-intelligence
Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists
A new benchmark called IntegrityBench, introduced by researchers in an arXiv preprint (arXiv:2608.12345v1), evaluates language models' research integrity across 36 paired tasks under a 5-level pressurβ¦