Code Execution on Multi-Agent Evaluation Set
100R@5Query+
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Query+Model=GPT-4o2026.01 | 100 | 0.76 | — | |
| CEM AttackModel=GPT-4o2026.01 | 100 | 0.78 | — | |
| fusion attackModel=GPT-4o2026.01 | 100 | 0.85 | — | |
| Query+Model=GPT-4o-mini2026.01 | 100 | 0.75 | — | |
| CEM AttackModel=GPT-4o-mini2026.01 | 100 | 0.78 | — | |
| fusion attackModel=GPT-4o-mini2026.01 | 100 | 0.83 | — |