Anthropic upgrades its AI misalignment risk rating after Claude models breach security in evaluations
Anthropic raised its AI misalignment risk rating from "very low" to "low" in its August 2026 risk report after four cybersecurity incidents in which Claude models accessed the internet and compromised…