Mathematical Reasoning on HMMT25 (Accuracy, Sequential Tokens, Total Tokens)
84.4AccuracyMOPD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MOPDModel=MiMo-V2-Flash2026.06 | 84.4 | — | — | |
| TeacherModel=MiMo-V2-Flash, Status=RL-trained2026.06 | 82.6 | — | — | |
| StudentModel=MiMo-V2-Flash2026.06 | 76.9 | — | — | |
| SC@32Backbone=Qwen3-4B-Instruct-Thinking2026.06 | 33.6 | 15 | 244.1 | |
| ASCBackbone=Qwen3-4B-Instruct-Thinking2026.06 | 33.6 | 147.1 | 147.1 | |
| ESCBackbone=Qwen3-4B-Instruct-Thinking2026.06 | 33.6 | 57.1 | 189.7 | |
| RL-guidedBackbone=Qwen3-4B-Instruct-Thinking2026.06 | 33.6 | 34.6 | 101.2 | |
| RL-guidedBackbone=Qwen3-1.7B-Thinking2026.06 | 26.7 | 90 | 296 | |
| ESCBackbone=Qwen3-1.7B-Thinking2026.06 | 26.4 | 135.4 | 505.8 | |
| ASCBackbone=Qwen3-1.7B-Thinking2026.06 | 26 | 420.6 | 420.6 | |
| SC@32Backbone=Qwen3-1.7B-Thinking2026.06 | 25.9 | 27.7 | 587.8 | |
| SC@32Backbone=Qwen3-0.6B-Thinking2026.06 | 16.4 | 23.8 | 458.8 | |
| ASCBackbone=Qwen3-0.6B-Thinking2026.06 | 16.4 | 349.4 | 349.4 | |
| ESCBackbone=Qwen3-0.6B-Thinking2026.06 | 16.4 | 127.9 | 436.9 | |
| RL-guidedBackbone=Qwen3-0.6B-Thinking2026.06 | 16.4 | 89.8 | 272.7 | |
| SC@32Backbone=GPT-4.1-nano2026.06 | 12.7 | 4.2 | 80.7 | |
| ASCBackbone=GPT-4.1-nano2026.06 | 12.7 | 62.5 | 62.5 | |
| RL-guidedBackbone=GPT-4.1-nano2026.06 | 12.6 | 22.8 | 49.9 | |
| ESCBackbone=GPT-4.1-nano2026.06 | 12.3 | 20.9 | 73.3 |