BREAKING
OpenAI Unveils GPT-Red
Adversarial Self-Play Loop
1
Attacker probes
↓
2
Successful hack
↓
3
Convert to data
↓
4
Harden defender
0
x
lower failure rate
Internal-Only, Never Shipped
Upside vs Risk
Upside
Praise
●
Scales red-teaming
●
Validated security gains
Risk
Concern
●
Offensive AI could leak
●
Limited outside review
Defenders Go on Offense
AI NEWS BLITZ
OpenAI has revealed an internal AI built to hack and harden its own models.