Mathematical Reasoning Accuracy on OlympiadBench (test)
57.9AccuracyMiMo-VL-7B-SFT-2508
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MiMo-VL-7B-SFT-25082025.12 | 57.9 | — | |
| MiMo-VL-Miloco-7B2025.12 | 57.9 | — | |
| RandOptModel=Qwen2.5-3B-Inst, K=502026.05 | 39.2 | — | |
| CoRPModel=OLMo3-7B-Inst2026.05 | 39.2 | — | |
| RandOptModel=OLMo3-7B-Inst, K=12026.05 | 37.5 | — | |
| RandOptModel=OLMo3-7B-Inst, K=502026.05 | 35.4 | — | |
| PPOModel=Qwen2.5-3B-Inst2026.05 | 34.4 | — | |
| CoRPModel=Qwen2.5-3B-Inst2026.05 | 32.5 | — | |
| RandOptModel=Llama3.1-8B-Inst, K=502026.05 | 32.1 | — | |
| RandOptModel=Qwen2.5-1.5B-Inst, K=502026.05 | 30.4 | — | |
| RandOptModel=Qwen2.5-3B-Inst, K=12026.05 | 30.3 | — | |
| GRPOModel=Qwen2.5-3B-Inst2026.05 | 29 | — | |
| BaseModel=OLMo3-7B-Inst2026.05 | 28.7 | — | |
| PPOModel=OLMo3-7B-Inst2026.05 | 28 | — | |
| GRPOModel=OLMo3-7B-Inst2026.05 | 27.9 | — | |
| PPOModel=Qwen2.5-1.5B-Inst2026.05 | 26.3 | — | |
| BaseModel=Qwen2.5-3B-Inst2026.05 | 24.5 | — | |
| GRPOModel=Llama3.1-8B-Inst2026.05 | 23.7 | — | |
| CoRPModel=Llama3.1-8B-Inst2026.05 | 20.9 | — | |
| CoRPModel=Qwen2.5-1.5B-Inst2026.05 | 20.5 | — | |
| RandOptModel=Qwen2.5-1.5B-Inst, K=12026.05 | 19.9 | — | |
| BaseModel=Llama3.1-8B-Inst2026.05 | 19.2 | — | |
| GRPOModel=Qwen2.5-1.5B-Inst2026.05 | 18.8 | — | |
| PPOModel=Qwen2.5-0.5B-Inst2026.05 | 16.1 | — | |
| PPOModel=Llama3.1-8B-Inst2026.05 | 16.1 | — | |
| RandOptModel=Qwen2.5-0.5B-Inst, K=502026.05 | 15.8 | — | |
| BaseModel=Qwen2.5-1.5B-Inst2026.05 | 13.4 | — | |
| RandOptModel=Llama3.1-8B-Inst, K=12026.05 | 11.9 | — | |
| CoRPModel=Qwen2.5-0.5B-Inst2026.05 | 9.6 | — | |
| RandOptModel=Qwen2.5-0.5B-Inst, K=12026.05 | 8.6 | — | |
| GRPOModel=Qwen2.5-0.5B-Inst2026.05 | 6.9 | — | |
| CoDistill-GRPOAlgorithm=CoDistill-GRPO, Base Model=Llama3.2-1B-Instruct, alpha=1, T=02026.05 | 5.086 | — | |
| GRPOAlgorithm=GRPO, Base Model=Llama3.2-1B-Instruct2026.05 | 5.038 | — | |
| VINEPPO + LILOTraining run=VINEPPO with LILO2025.02 | 4.5 | — | |
| Llama3.2-1B-InstructAlgorithm=Llama3.2-1B-Instruct2026.05 | 4.328 | — | |
| BaseModel=Qwen2.5-0.5B-Inst2026.05 | 4.2 | — | |
| VINEPPOTraining run=VINEPPO2025.02 | 4.1 | — | |
| PPO + LILOTraining run=PPO with LILO2025.02 | 3.8 | — | |
| PPOTraining run=PPO2025.02 | 3.5 | — | |
| ORIGINAL SFTTraining run=SFT2025.02 | 2.6 | — | |
| ADARFTModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 32.4 | |
| ADARFTModel=Qwen2.5-Math-7B, Evaluation Step=9002026.05 | — | 38.6 | |
| CHORD-ϕShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 42.47 | |
| DAPOModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 34.4 | |
| DIFFModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 34.7 | |
| DIFFModel=Qwen2.5-Math-7B, Evaluation Step=9002026.05 | — | 42.6 | |
| FEST-DPOShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 46.8 | |
| FEST-GRPOShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 47 | |
| GAINRLModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 34.9 | |
| GAINRLModel=Qwen2.5-Math-7B, Evaluation Step=9002026.05 | — | 41.7 | |
| GRPOModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 34.8 | |
| GRPOModel=Qwen2.5-Math-7B, Evaluation Step=9002026.05 | — | 42 | |
| HPTShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 43.14 | |
| HPT-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | 34.34 | |
| LUFFYShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 43.49 | |
| MIFOShot Configuration=Full dataset, RL on Gold Dataset (DE)=false2026.05 | — | 43.3 | |
| ReLIFTShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 44.35 | |
| ReLIFT-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | 42.28 | |
| RLShot Configuration=128-shot, RL on Gold Dataset (DE)=false2026.05 | — | 43.25 | |
| RL-GShot Configuration=128-shot, RL on Gold Dataset (DE)=true2026.05 | — | 44.49 | |
| SAERLDModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 34.6 | |
| SAERLGModel=Qwen2.5-Math-1.5B, Evaluation Step=9002026.05 | — | 35.7 | |
| SAERLGModel=Qwen2.5-Math-7B, Evaluation Step=9002026.05 | — | 43 | |
| SRFTShot Configuration=Full dataset, RL on Gold Dataset (DE)=false2026.05 | — | 38.58 |