04:00
2026-07-29
arxiv.org
artificial-intelligence
CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models
A new study introducing CogArena, a 13-paradigm benchmark for evaluating cognitive ability structure in large language models, finds that across 55 open-weight models, paradigm correlations are positiβ¦