AI Safety Evaluation on AEGIS AI Safety Benchmark 2.0 August 2025
88.04AccuracyMulti-Agent Framework
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Multi-Agent FrameworkBackbone=gpt-5, n=12026.02 | 88.04 | 0.2 | 1 | 11.2 | 12.3 | |
| Multi-Agent FrameworkBackbone=gpt-5, n=32026.02 | 84.82 | 2.6 | 0.6 | 12.8 | 42.1 | |
| Multi-Agent FrameworkBackbone=gpt-5, n=52026.02 | 84.29 | 4.2 | 0.6 | 12 | 83.6 | |
| BaselineAgent Framework=Single Agent with CoT, Backbone=gpt-52026.02 | 69.82 | 17.2 | 0.2 | 14.8 | 17.7 |