14:32
2026-10-01
goodhartlabs.com
ai-safety
HoneyBench β A general benchmark for reward hacking in frontier models
Goodhart Labs released HoneyBench v0.1, a nine-task benchmark for reward hacking in frontier models including Opus 5.5, Fable 5.1, GPT-6 Astra, Gemini 3.8 Flash, Grok 4.7, and DeepSeek V4 Pro. The labβ¦