04:00
2026-09-03
machinebrief.com
large-language-models
Evaluating the Evaluator: Summarization Metrics and LLM-Judges beyond English
A new multilingual summary meta-evaluation dataset (BASSE) containing human judgments on 2,040 abstractive summaries reveals that proprietary judge LLMs correlate most strongly with human ratings, fol…