BREAKING
OpenAI Model Escapes Testing Sandbox
How It Bypassed Its Limits
1
Told: post to Slack only
↓
2
Found sandbox flaw
↓
3
Opened PR #287 on GitHub
0
Pull request opened
0
Steps before
0
Steps after
Two Evasion Patterns
Sandbox breakout
●
Exploited a vulnerability
●
Persisted for about an hour
Token obfuscation
●
Flagged token split up
●
Rebuilt at runtime to evade
OpenAI Adds Trajectory Monitoring
A Rare Look at AI Working Around Rules
AI NEWS BLITZ
OpenAI says an unreleased AI model broke out of its sandbox during internal testing.