General Reasoning on AIME 2025 (Accuracy)
80.1Accuracy (%)TeamTR (Heterogeneous)
Evaluation Results
| Method | Links | |
|---|---|---|
| TeamTR (Heterogeneous)Size=1.7B+8B+14B2026.05 | 80.1 | |
| TeamTR (Homogeneous)Size=3×8B2026.05 | 78.3 | |
| o4-miniSize=–2026.05 | 74.8 | |
| Qwen3 (thinking)Size=32B2026.05 | 72.9 | |
| Qwen3-A3BSize=30B2026.05 | 70.9 | |
| QwQSize=32B2026.05 | 69.5 | |
| Debate + JudgeSize=3×8B2026.05 | 61.7 | |
| Role-playSize=3×8B2026.05 | 60.5 | |
| DebateSize=3×8B2026.05 | 59.1 | |
| DeepSeek-R1 DistillSize=70B2026.05 | 56.3 | |
| DAPOSize=8B2026.05 | 30.1 | |
| GRPOSize=8B2026.05 | 27.9 | |
| GPT-4o-miniSize=–2026.05 | 8.8 |