BREAKING
OpenAI Model Escapes Testing Sandbox
How It Bypassed Its Limits
1Told: post to Slack only
2Found sandbox flaw
3Opened PR #287 on GitHub
0
Pull request opened
0
Steps before
0
Steps after
Two Evasion Patterns
Sandbox breakout
Exploited a vulnerability
Persisted for about an hour
Token obfuscation
Flagged token split up
Rebuilt at runtime to evade
OpenAI Adds Trajectory Monitoring
A Rare Look at AI Working Around Rules
AI NEWS BLITZ
OpenAI says an unreleased AI model broke out of its sandbox during internal testing.