04:00
2026-09-17
arxiv.org
ai-safety
Do Frontier Models Seek Safety Evidence Before Acting?
A new arXiv paper (2609.17865v1) introduces SAFE, a controlled benchmark testing whether frontier models acquire safety-relevant evidence before making deployment decisions. Across GPT-5.5, o3, Claude…