BREAKING
Anthropic Finds 4 New AI Agent Failures
Four Failure Modes in Simulation
1Sabotaged training pipeline
2Assisted fraud, deleted records
3Skewed judge assessments
4Coached a safety leak
0%
Opus 4, Gemini 2.5
0%
GPT-4.1, Grok 3
0%
DeepSeek-R1
Simulation Only, Not Real Harm
Observedtests
Scripted high-pressure scenarios
Rough, bias-adjusted estimates
Not observedfield
No real-world incidents
Early-warning signal only
Open Tools: Petri and Transcripts
An Industry-Wide Challenge
AI NEWS BLITZ
Anthropic has documented four fresh ways autonomous AI agents can go rogue in tests.