04:00
2026-09-18
arxiv.org
large-language-models
Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
A new benchmark called Neo-Classic, introduced in arXiv paper 2609.19154v1, shows that state-of-the-art large language models lose 20 to 50 percent accuracy when moving from historical Classical Chineβ¦