Math Reasoning on GSM8K (Relative Overall and Avg Rank)
97.22Relative Overall ScoreJensen-Shannon
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Jensen-ShannonBackbone=Qwen2.5-Math-1.5B2026.02 | 97.22 | 2.2 | |
| Total VariationBackbone=Qwen2.5-Math-7B2026.02 | 95.27 | 3.2 | |
| HellingerBackbone=Qwen2.5-Math-7B2026.02 | 95.08 | 3.8 | |
| Total VariationBackbone=Qwen2.5-Math-1.5B2026.02 | 94.27 | 4.4 | |
| Jensen-ShannonBackbone=Qwen2.5-Math-7B2026.02 | 91.44 | 3.2 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.02 | 90.71 | 4.4 | |
| Reverse KLBackbone=Qwen2.5-Math-7B2026.02 | 90.46 | 3.8 | |
| Reverse KLBackbone=Qwen2.5-Math-1.5B2026.02 | 88.07 | 3.4 | |
| PearsonBackbone=Qwen2.5-Math-7B2026.02 | 87.82 | 3.6 | |
| KLBackbone=Qwen2.5-Math-7B2026.02 | 86.6 | 5.2 | |
| HellingerBackbone=Qwen2.5-Math-1.5B2026.02 | 86.24 | 3.8 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.02 | 86.17 | 4 | |
| PearsonBackbone=Qwen2.5-Math-1.5B2026.02 | 84.23 | 4 | |
| Qwen3Architecture=Dense, # Total Params=8.0B, # Trained Tokens=36T2025.10 | 83.09 | — | |
| Ouro 2.6B R4Architecture=LoopLM, # Total Params=2.6B, # Trained Tokens=7.7T2025.10 | 81.58 | — | |
| Qwen2.5Architecture=Dense, # Total Params=7.0B, # Trained Tokens=18T2025.10 | 81.5 | — | |
| KLBackbone=Qwen2.5-Math-1.5B2026.02 | 79.65 | 6 | |
| Llama3.1Architecture=Dense, # Total Params=8.0B, # Trained Tokens=15T2025.10 | 78.17 | — | |
| Gemma3Architecture=Dense, # Total Params=12.0B, # Trained Tokens=12T2025.10 | 77.18 | — | |
| Qwen2.5Architecture=Dense, # Total Params=3.0B, # Trained Tokens=18T2025.10 | 74.6 | — | |
| Qwen3Architecture=Dense, # Total Params=4.0B, # Trained Tokens=36T2025.10 | 72.86 | — | |
| Gemma3Architecture=Dense, # Total Params=4.0B, # Trained Tokens=4T2025.10 | 68.69 | — | |
| Llama3.2Architecture=Dense, # Total Params=3.0B, # Trained Tokens=9T2025.10 | 67.2 | — | |
| BaseBackbone=Qwen2.5-Math-1.5B2026.02 | 0 | 8 | |
| BaseBackbone=Qwen2.5-Math-7B2026.02 | 0 | 8 |