04:00
2026-09-03
machinebrief.com
artificial-intelligence
CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI
Researchers introduced CivBench, an open-source benchmark for evaluating language model agents in long-horizon, tool-mediated environments via the Model Context Protocol (MCP), featuring 300+ turn epi…