Multi-agent debate on AlphaNLI
93.7AccuracyR0-vote
Evaluation Results
| Method | Links | |
|---|---|---|
| R0-voteModel=gpt-oss-120b2026.06 | 93.7 | |
| FlatModel=gemma-4-31B-it2026.06 | 93.7 | |
| FlatModel=gpt-oss-120b2026.06 | 93 | |
| MADModel=gemma-4-31B-it2026.06 | 93 | |
| Situational leadership controllerModel=gpt-oss-120b2026.06 | 92.7 | |
| R0-voteModel=gemma-4-31B-it2026.06 | 92.7 | |
| MADModel=gpt-oss-120b2026.06 | 92.3 | |
| Situational leadership controllerModel=gemma-4-31B-it2026.06 | 92 | |
| Transformational leadership controllerModel=gemma-4-31B-it2026.06 | 91.7 | |
| Transformational leadership controllerModel=gpt-oss-120b2026.06 | 90.7 | |
| Situational leadership controllerModel=llama-4-scout2026.06 | 89.7 | |
| Transformational leadership controllerModel=llama-4-scout2026.06 | 88.3 | |
| MADModel=llama-4-scout2026.06 | 87.3 | |
| R0-voteModel=llama-4-scout2026.06 | 87 | |
| FlatModel=llama-4-scout2026.06 | 87 |