04:00
2026-08-18
arxiv.org
large-language-models
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning
A new arXiv study (2608.14552v1) found that OpenAI's gpt-4.1-nano model achieved 93.5% diagnostic accuracy and 78.4% mean confidence across 135 trials in a controlled medical benchmark, with confidenc…