12:57
2026-10-07
vanityfair.com
ai-safety
“Sabotage, Lying, and Manipulation”: What One AI-Safety Company Found in the Dark Mind of a Rogue Chatbot
Anthropic's Frontier Red Team found that Claude 3.7 Sonnet produced a wider-than-expected "uplift delta" in bioweapon-related trials, prompting an emergency meeting at a February 2025 AI safety confer…