Science on MMLU-Pro
90.1AccuracyGemini-3-pro High
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3-pro High2026.06 | 90.1 | |
| Claude-Opus-4.52026.06 | 89.3 | |
| Claude-Sonnet-4.52026.06 | 88 | |
| Seed2.0 Pro2026.06 | 87 | |
| GPT-5.2 High2026.06 | 85.9 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.05 | 41.9 | |
| BaseBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Pre-trained2026.05 | 41.9 | |
| Self-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 38.6 | |
| Low-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 37.8 | |
| Iter-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 37.7 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct2026.05 | 37.7 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 1: iGSM2026.05 | 37.7 | |
| Anchored LearningBackbone=Llama-3.2-3B-Instruct2026.05 | 36.8 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 3: iGSM -> MedCalc -> IFEval2026.05 | 36.8 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 3: iGSM -> MedCalc -> IFEval2026.05 | 36.6 | |
| Low-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 36.3 | |
| KL-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 35.5 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.05 | 34.7 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.05 | 34.7 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.05 | 34.7 | |
| DFTBackbone=Llama-3.2-3B-Instruct2026.05 | 34.7 | |
| Anchored LearningBackbone=Llama-3.2-3B-Instruct2026.05 | 34.3 | |
| Anchored LearningBackbone=Llama-3.2-3B-Instruct2026.05 | 33.3 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 33.3 | |
| STMBackbone=Llama-3.2-3B-Instruct2026.05 | 33.3 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 1: iGSM2026.05 | 33.3 | |
| Low-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 33.2 | |
| SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 32.7 | |
| Iter-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 32.2 | |
| STMBackbone=Qwen2.5-3B-Instruct2026.05 | 32.1 | |
| Self-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 31.2 | |
| Iter-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 30.9 | |
| Anchored LearningBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 2: iGSM -> MedCalc2026.05 | 30.8 | |
| Low-SFTBackbone=Qwen2.5-3B-Instruct, Incremental Learning Stage=Stage 2: iGSM -> MedCalc2026.05 | 29.9 | |
| Self-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 29.6 | |
| STMBackbone=Llama-3.2-3B-Instruct2026.05 | 29.2 | |
| DFTBackbone=Llama-3.2-3B-Instruct2026.05 | 28 | |
| Iter-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 28 | |
| Self-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 26.9 | |
| STMBackbone=Llama-3.2-3B-Instruct2026.05 | 24.3 | |
| DFTBackbone=Qwen2.5-3B-Instruct2026.05 | 16.3 | |
| KL-SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 10.2 | |
| KL-SFT 0.2Backbone=Llama-3.2-3B-Instruct2026.05 | 9.6 | |
| DFTBackbone=Llama-3.2-3B-Instruct2026.05 | 8.2 | |
| SFTBackbone=Qwen2.5-3B-Instruct2026.05 | 3.1 | |
| KL-SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 2 | |
| SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 1.2 | |
| SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 1.1 |