Multiple-choice Reasoning on GPQA full dataset
66.29AccuracyMeta-Debate
Evaluation Results
| Method | Links | |
|---|---|---|
| Meta-DebateRole assignment strategy=Capability-aware assignment, Debate method=DMAD2026.01 | 66.29 | |
| Random assignment (Run 3)Debate method=DMAD2026.01 | 60.27 | |
| Meta-DebateRole assignment strategy=Capability-aware assignment, Debate method=MAD2026.01 | 59.15 | |
| Claude for all rolesDebate method=DMAD2026.01 | 58.93 | |
| Random assignment (Run 2)Debate method=DMAD2026.01 | 58.26 | |
| Random assignment (Run 3)Debate method=MAD2026.01 | 55.58 | |
| Nova for all rolesDebate method=DMAD2026.01 | 54.46 | |
| Claude for all rolesDebate method=MAD2026.01 | 54.24 | |
| Random assignment (Run 1)Debate method=DMAD2026.01 | 53.57 | |
| Nova for all rolesDebate method=MAD2026.01 | 52.46 | |
| Random assignment (Run 2)Debate method=MAD2026.01 | 52.23 | |
| Random assignment (Run 1)Debate method=MAD2026.01 | 50.67 | |
| Pixtral for all rolesDebate method=DMAD2026.01 | 50.45 | |
| Pixtral for all rolesDebate method=MAD2026.01 | 44.64 | |
| DeIllusionLLMDistillation source=GPT-4, Backbone model=Qwen2.5-72B, Prompting protocol=zero-shot2026.03 | 38.8 | |
| GPT-4Prompting protocol=zero-shot2026.03 | 34.2 | |
| Qwen2.5-72BPrompting protocol=zero-shot2026.03 | 34.15 | |
| DeIllusionLLMDistillation source=Qwen2.5-72B, Backbone model=Qwen2.5-72B, Prompting protocol=zero-shot2026.03 | 33.93 | |
| Mixtral-8x7BPrompting protocol=zero-shot2026.03 | 30.13 | |
| Llama3.3 70BPrompting protocol=zero-shot2026.03 | 21.88 |