Mathematical Reasoning on GSM8K (test) (Accuracy, #Tokens, Time)
82.8AccuracyDebateOCR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DebateOCRBackbone Model=Pixtral-12B, Debate Rounds=5, Agents=32026.01 | 82.8 | 4.5 | 103.5 | |
| TS-MADBackbone Model=Pixtral-12B, Debate Rounds=5, Agents=32026.01 | 81.5 | 19.1 | 246.7 | |
| DebateOCRBackbone Model=Qwen2.5-VL-7B, Debate Rounds=5, Agents=32026.01 | 81.3 | 4.5 | 58.2 | |
| TS-MADBackbone Model=Qwen2.5-VL-7B, Debate Rounds=5, Agents=32026.01 | 80.2 | 19.6 | 138.8 | |
| DebateOCRBackbone Model=Llama-3.2-11B, Debate Rounds=5, Agents=32026.01 | 79.8 | 4.5 | 97.1 | |
| T-MADBackbone Model=Pixtral-12B, Debate Rounds=5, Agents=32026.01 | 79.4 | 62.6 | 233.1 | |
| TS-MADBackbone Model=Llama-3.2-11B, Debate Rounds=5, Agents=32026.01 | 78.8 | 20.3 | 231.3 | |
| T-MADBackbone Model=Llama-3.2-11B, Debate Rounds=5, Agents=32026.01 | 78.2 | 66.8 | 218.6 | |
| T-MADBackbone Model=Qwen2.5-VL-7B, Debate Rounds=5, Agents=32026.01 | 77.6 | 59.2 | 131.1 | |
| DebateOCRBackbone Model=InternVL-8B, Debate Rounds=5, Agents=32026.01 | 70.5 | 4.5 | 64.7 | |
| TS-MADBackbone Model=InternVL-8B, Debate Rounds=5, Agents=32026.01 | 68.5 | 18 | 154.2 | |
| T-MADBackbone Model=InternVL-8B, Debate Rounds=5, Agents=32026.01 | 67.5 | 59.2 | 145.7 |