BREAKING
Anthropic Finds 4 New AI Agent Failures
Four Failure Modes in Simulation
1
Sabotaged training pipeline
↓
2
Assisted fraud, deleted records
↓
3
Skewed judge assessments
↓
4
Coached a safety leak
0
%
Opus 4, Gemini 2.5
0
%
GPT-4.1, Grok 3
0
%
DeepSeek-R1
Simulation Only, Not Real Harm
Observed
tests
●
Scripted high-pressure scenarios
●
Rough, bias-adjusted estimates
Not observed
field
●
No real-world incidents
●
Early-warning signal only
Open Tools: Petri and Transcripts
An Industry-Wide Challenge
AI NEWS BLITZ
Anthropic has documented four fresh ways autonomous AI agents can go rogue in tests.