Mathematical Reasoning on MGSM (Multilingual)
88.8Accuracy (Bn)polyGRPO w/ R1-format
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| polyGRPO w/ R1-formatBase Model=Qwen3-8B, Format=R1-format2026.04 | 88.8 | 90.8 | 61.2 | 85.6 | 88.4 | 91.2 | 90.8 | 94.4 | 92.4 | 97.2 | — | 90.47 | 87.27 | 79.2 | — | — | 80 | |
| FFTAnchor=English2026.06 | 88.4 | 84 | 80.4 | — | — | — | — | — | — | 96 | — | — | 87.2 | — | — | — | — | |
| SARAAnchor=English2026.06 | 88 | 80.8 | 83.2 | — | — | — | — | — | — | 97.6 | — | — | 87.4 | — | — | — | — | |
| ShifConAnchor=English2026.06 | 87.6 | 80.4 | 82.4 | — | — | — | — | — | — | 97.2 | — | — | 86.9 | — | — | — | — | |
| FFTAnchor=Chinese2026.06 | 86 | 83.6 | 76.8 | — | 94.8 | — | — | — | — | — | — | — | 85.3 | — | — | — | — | |
| SARAAnchor=Chinese2026.06 | 85.6 | 80.8 | 79.2 | — | 87.2 | — | — | — | — | — | — | — | 83.2 | — | — | — | — | |
| AESAnchor=English2026.06 | 85.2 | 78.4 | 76 | — | — | — | — | — | — | 94.4 | — | — | 83.5 | — | — | — | — | |
| ShifConAnchor=Chinese2026.06 | 85.2 | 80.4 | 78.4 | — | 86.8 | — | — | — | — | — | — | — | 82.7 | — | — | — | — | |
| Vanilla LMAnchor=None2026.06 | 84.8 | 77.6 | 48.4 | — | 89.2 | — | — | — | — | 96 | — | — | 79.2 | — | — | — | — | |
| AESAnchor=Chinese2026.06 | 82.4 | 77.6 | 74 | — | 84.8 | — | — | — | — | — | — | — | 79.7 | — | — | — | — | |
| BaseBase Model=Qwen3-8B2026.04 | 80 | 84.4 | 55.6 | 83.2 | 85.2 | 84.4 | 82 | 88 | 86.8 | 93.6 | — | 84.93 | 81.45 | 72.8 | — | — | 73.2 | |
| Qwen2.5-3B-Instruct + GRPO-TransTestBackbone=Qwen2.5-3B-Instruct, Training Method=GRPO-TransTest2026.03 | 75.7 | 82.9 | 40.9 | 78.2 | 80.6 | 84.6 | 83.9 | 85.4 | 87.2 | 90.5 | — | — | 65.8 | 51.2 | — | 76.4 | — | |
| polyGRPO w/ R1-formatBase Model=Qwen2.5-7B, Format=R1-format2026.04 | 75.6 | 84.8 | 38 | 79.2 | 88 | 82.8 | 83.2 | 86 | 83.6 | 88.8 | — | 83.8 | 76.07 | 46.8 | — | — | 61.3 | |
| Qwen2.5-3B-Instruct + GRPO-EnCoTBackbone=Qwen2.5-3B-Instruct, Training Method=GRPO-EnCoT2026.03 | 75.2 | 82.2 | 39 | 78.7 | 81.4 | 84 | 82.7 | 85.8 | 84.7 | 89.4 | — | — | 65.2 | 51 | — | 75.8 | — | |
| Qwen2.5-3B-Instruct + TAPO-XCOMETBackbone=Qwen2.5-3B-Instruct, Training Method=TAPO-XCOMET2026.03 | 75 | 82.2 | 45.3 | 78.4 | 80.8 | 83.6 | 82.9 | 84.1 | 84.5 | 89.8 | — | — | 66.4 | 51.4 | — | 76.2 | — | |
| Qwen2.5-3B-Instruct + TAPO-ChrF++Backbone=Qwen2.5-3B-Instruct, Training Method=TAPO-ChrF++2026.03 | 75 | 82.9 | 49 | 76.8 | 82.2 | 85 | 82.3 | 84.1 | 86.5 | 91.7 | — | — | 67.3 | 52.7 | — | 77.1 | — | |
| MERLINDecoder Model=Gemma 2 9B, Multilingual Encoder=NLLB-600M-distilled2025.09 | 74.8 | 76 | 77.6 | 71.6 | 72.8 | 73.2 | 74.8 | 78.4 | 77.6 | 85.6 | 76.1 | 76.3 | 76.2 | — | — | — | — | |
| Qwen2.5-3B-Instruct + TAPO-CKBackbone=Qwen2.5-3B-Instruct, Training Method=TAPO-CK2026.03 | 73.6 | 82.7 | 46.7 | 77.3 | 79 | 85.4 | 83.6 | 84.9 | 85.1 | 89.5 | — | — | 66.8 | 53.6 | — | 76.5 | — | |
| polyGRPOBase Model=Qwen2.5-7B2026.04 | 70.8 | 83.6 | 38 | 73.2 | 84.4 | 82 | 82.8 | 87.2 | 85.6 | 92 | — | 82.53 | 74.76 | 42.8 | — | — | 58.8 | |
| Llama3.2-3B-Instruct + TAPO-ChrF++Backbone=Llama3.2-3B-Instruct, Training Method=TAPO-ChrF++2026.03 | 69.7 | 73.8 | 72.1 | 72 | 79.7 | 80 | 78.7 | 78.6 | 84.6 | 87.3 | — | — | 75 | 64.3 | — | 76.4 | — | |
| Llama3.2-3B-Instruct + TAPO-CKBackbone=Llama3.2-3B-Instruct, Training Method=TAPO-CK2026.03 | 68.8 | 73.1 | 71.9 | 71 | 77.9 | 78.8 | 76.7 | 78.1 | 79.3 | 86.8 | — | — | 74.1 | 64.6 | — | 75.2 | — | |
| Llama3.2-3B-Instruct + TAPO-XCOMETBackbone=Llama3.2-3B-Instruct, Training Method=TAPO-XCOMET2026.03 | 68.7 | 76.1 | 71.7 | 71.4 | 77.2 | 78.7 | 77.6 | 79.3 | 81.4 | 87.6 | — | — | 74.5 | 66.3 | — | 76 | — | |
| Llama3.2-3B-Instruct + GRPO-TransTestBackbone=Llama3.2-3B-Instruct, Training Method=GRPO-TransTest2026.03 | 67.6 | 74.8 | 70.3 | 70 | 75.6 | 79.7 | 77.8 | 78.9 | 81.5 | 86 | — | — | 73.6 | 64.4 | — | 75.1 | — | |
| MindMergerDecoder Model=Gemma 2 9B, Multilingual Encoder=NLLB-600M-distilled2025.09 | 66.8 | 72.8 | 69.2 | 66.8 | 72.8 | 78 | 75.2 | 73.6 | 76.4 | 82.4 | 69.6 | 75 | 73.4 | — | — | — | — | |
| Llama3.2-3B-Instruct + GRPO-EnCoTBackbone=Llama3.2-3B-Instruct, Training Method=GRPO-EnCoT2026.03 | 66.2 | 71.3 | 68.8 | 69.2 | 73 | 76.7 | 76.4 | 76.6 | 79.7 | 86.7 | — | — | 71.2 | 60.4 | — | 73.2 | — | |
| GRPOBase Model=Qwen2.5-7B2026.04 | 65.2 | 77.6 | 36 | 69.6 | 80.4 | 80.4 | 79.6 | 81.2 | 80.8 | 90.4 | — | 78.67 | 70.98 | 39.6 | — | — | 54.6 | |
| self-cons (ours)Base Model=Llama3-8B2026.05 | 64.4 | 41.6 | 59.2 | 57.2 | 68.4 | 76.4 | 72 | 69.6 | 74.8 | 82.4 | — | — | 65.5 | — | — | — | — | |
| SLAMDecoder Model=Gemma 2 9B, Multilingual Encoder=NLLB-600M-distilled2025.09 | 63.2 | 61.2 | 52.4 | 62.4 | 64.4 | 68.8 | 53.6 | 70 | 69.2 | 69.2 | 58.9 | 65.4 | 63.4 | — | — | — | — | |
| Llama3.2-3B-Instruct + RAFTBackbone=Llama3.2-3B-Instruct, Training Method=RAFT2026.03 | 62.2 | 66.1 | 64.2 | 64.9 | 69.6 | 73.5 | 73.2 | 73.6 | 76 | 81.9 | — | — | 67.1 | 59.6 | — | 69.5 | — | |
| Qwen2.5-3B-Instruct + RAFTBackbone=Qwen2.5-3B-Instruct, Training Method=RAFT2026.03 | 60.7 | 68.1 | 24.6 | 62.4 | 70.3 | 71.6 | 69 | 71.3 | 73.8 | 80.4 | — | — | 50.5 | 36.8 | — | 62.6 | — | |
| QAlign-LoRADecoder Model=Gemma 2 9B, Multilingual Encoder=NLLB-600M-distilled2025.09 | 58 | 60.8 | 62 | 56.4 | 62.4 | 68.8 | 68 | 68 | 76.8 | 80.8 | 60.3 | 68.7 | 66.2 | — | — | — | — | |
| Qwen2.5-3B-InstructBackbone=Qwen2.5-3B-Instruct, Training Method=Base Model2026.03 | 56.5 | 67.5 | 13.2 | 67.2 | 73.6 | 77.7 | 75 | 79 | 78 | 85.5 | — | — | 44.8 | 19.9 | — | 44.8 | — | |
| Gemma 2 9BDecoder Model=Gemma 2 9B, Group=Open Models2025.09 | 56.4 | 66.4 | 64.4 | 65.2 | 69.6 | 70.4 | 59.2 | 67.6 | 72 | 76 | 62.4 | 68.6 | 66.7 | — | — | — | — | |
| LIDRBase Model=Qwen2.5-7B2026.04 | 55.6 | 68 | 20 | 64.8 | 79.2 | 67.6 | 68.4 | 72.4 | 69.6 | 88.8 | — | 70.33 | 61.67 | 24 | — | — | 41.9 | |
| ST-Merge2026.06 | 54 | 56.8 | 58.8 | 53.5 | 57.2 | 62.4 | 61.2 | 62.8 | 65.2 | 68 | 56.5 | 61.5 | 60 | — | — | — | — | |
| MAPOBase Model=Qwen2.5-7B2026.04 | 51.6 | 65.2 | 19.6 | 62 | 75.6 | 68 | 71.6 | 76.4 | 79.6 | 86 | — | 72.2 | 61.85 | 24.8 | — | — | 40.3 | |
| LayAlign2026.06 | 51.6 | 59.2 | 58.4 | 52 | 56 | 62 | 61.6 | 61.6 | 61.6 | 66.4 | 56.4 | 60.2 | 59 | — | — | — | — | |
| MindMerger2026.06 | 50.4 | 52.8 | 57.2 | 54.4 | 53.6 | 61.2 | 57.6 | 60.8 | 58.4 | 66.8 | 53.5 | 59 | 57.3 | — | — | — | — | |
| INCLINE-7BBase Model=Llama2-7B2026.05 | 48.4 | 43.2 | 38.8 | 44.8 | 42.8 | 51.2 | 37.6 | 38 | 45.2 | 46.8 | — | — | 43.7 | — | — | — | — | |
| Translate-En2026.06 | 48.4 | 37.6 | 37.6 | 49.2 | 46.8 | 60.4 | 56.4 | 47.6 | 59.6 | 65.5 | 41.2 | 55.1 | 50.6 | — | — | — | — | |
| LIDRBase Model=Llama3-8B2026.05 | 47.2 | 53.6 | 32.8 | 47.6 | 59.2 | 57 | 60.8 | 62 | 64 | 72 | — | — | 55.6 | — | — | — | — | |
| Llama3.2-3B-Instruct + SFT-TransTestBackbone=Llama3.2-3B-Instruct, Training Method=SFT-TransTest2026.03 | 45.3 | 44.5 | 49.1 | 54.2 | 50.9 | 45.6 | 59.4 | 54.8 | 64.8 | 55.4 | — | — | 47.1 | 53.3 | — | 52.5 | — | |
| MAPO-13BBase Model=Llama2-13B2026.05 | 44.8 | 47.6 | 55.2 | 56 | 59.6 | 59.2 | 63.6 | 59.3 | 62.8 | 71.6 | — | — | 58 | — | — | — | — | |
| MindMergerDecoder Model=Metamath 7B, Multilingual Encoder=mT5-XL2025.09 | 43.6 | 44.4 | 42.5 | 45.6 | 45.6 | 56.8 | 58 | 56 | 54 | 64 | 43.5 | 54.3 | 51.1 | — | — | — | — | |
| MERLINDecoder Model=Metamath 7B, Multilingual Encoder=mT5-XL2025.09 | 43.2 | 49.2 | 44.8 | 48.4 | 48.8 | 53.2 | 55.6 | 58 | 59.2 | 63.6 | 45.7 | 55.3 | 52.4 | — | — | — | — | |
| LangBridgeDecoder Model=Metamath 7B, Multilingual Encoder=mT5-XL2025.09 | 42.8 | 50.4 | 43.2 | 40 | 45.2 | 56.4 | 50.8 | 52.4 | 58 | 63.2 | 45.5 | 52.3 | 50.2 | — | — | — | — | |
| LangBridge2026.06 | 42.8 | 50.4 | 43.2 | 40 | 45.2 | 56.4 | 50.8 | 52.4 | 58 | 63.2 | 45.5 | 52.3 | 50.2 | — | — | — | — | |
| Llama3 8B-ITBase Model=Llama3-8B2026.05 | 42.4 | 35.6 | 31.6 | 40.8 | 49.6 | 58.8 | 57.2 | 58.8 | 64.4 | 73.2 | — | — | 51.2 | — | — | — | — | |
| MathOctopus-13BBase Model=Llama2-13B2026.05 | 42 | 46 | 46 | 39.6 | 51.2 | 49.2 | 49.6 | 47.6 | 53.2 | 51.6 | — | — | 47.6 | — | — | — | — | |
| MetaMathOctopus-13BBase Model=Llama2-13B2026.05 | 41.6 | 52.1 | 50.9 | 57.3 | 53.1 | 60.1 | 60.8 | 59.1 | 61.1 | 66.8 | — | — | 51.5 | — | — | — | — | |
| BaseBase Model=Qwen2.5-7B2026.04 | 38.8 | 38.8 | 9.2 | 53.2 | 73.2 | 64 | 63.2 | 69.2 | 68.8 | 74.4 | — | 65.27 | 51.45 | 13.2 | — | — | 25 | |
| MAPOBase Model=Llama3-8B2026.05 | 38.4 | 47.2 | 30.8 | 38.4 | 54 | 50.8 | 59.2 | 62 | 62.8 | 71.6 | — | — | 51.5 | — | — | — | — | |
| Llama2-13BBase Model=Llama2-13B2026.05 | 35.2 | 46.8 | 42.8 | 43.2 | 48.8 | 44.4 | 48.4 | 47.6 | 48 | 53.2 | — | — | 45.8 | — | — | — | — | |
| Llama3.2-3B-InstructBackbone=Llama3.2-3B-Instruct, Training Method=Base Model2026.03 | 34.7 | 48.7 | 27.1 | 44.1 | 54.6 | 56.8 | 56.7 | 58.3 | 61.6 | 73.6 | — | — | 44.4 | 31 | — | 49.7 | — | |
| MathOctopus-7BBase Model=Llama2-7B2026.05 | 33.2 | 36.4 | 38.4 | 35.6 | 45.2 | 43.6 | 38 | 48.4 | 45.2 | 54.8 | — | — | 41.9 | — | — | — | — | |
| MultiReason2026.06 | 33.2 | 40 | 42 | 42 | 42 | 45.2 | 44.8 | 45.2 | 48 | 52 | 38.4 | 45.6 | 43.4 | — | — | — | — | |
| QAlign-LoRADecoder Model=Metamath 7B, Multilingual Encoder=mT5-XL2025.09 | 32.4 | 39.6 | 40.4 | 44 | 48.4 | 54.8 | 56.8 | 52.4 | 59.6 | 68 | 37.5 | 54.9 | 49.6 | — | — | — | — | |
| QAlign2026.06 | 32.4 | 39.6 | 40.4 | 44 | 48.4 | 54.8 | 56.8 | 52.4 | 59.6 | 68 | 37.5 | 54.9 | 49.6 | — | — | — | — | |
| SLAMDecoder Model=Metamath 7B, Multilingual Encoder=mT5-XL2025.09 | 32 | 44 | 40 | 46 | 48.4 | 54 | 55.2 | 54.8 | 56.8 | 64.8 | 38.7 | 54.3 | 49.6 | — | — | — | — | |
| Qwen2.5-3B-Instruct + QAlignBackbone=Qwen2.5-3B-Instruct, Training Method=QAlign2026.03 | 32 | 50 | 6.4 | 46.4 | 63.6 | 61.2 | 60 | 60.4 | 62.4 | 70.8 | — | — | 29.1 | 10.8 | — | 47.6 | — | |
| Llama3.2-3B-Instruct + QAlignBackbone=Llama3.2-3B-Instruct, Training Method=QAlign2026.03 | 30.2 | 27.4 | 31.8 | 44.1 | 38.2 | 29.1 | 47 | 43.1 | 57.5 | 43.5 | — | — | 31.3 | 41.6 | — | 39.4 | — | |
| Llama2-7BBase Model=Llama2-7B2026.05 | 18.8 | 21.6 | 23.6 | 27.2 | 31.6 | 38 | 36.4 | 33.6 | 39.2 | 52 | — | — | 32.2 | — | — | — | — | |
| MetaMath2026.06 | 6.8 | 7.2 | 6.8 | 36.4 | 38.4 | 55.2 | 54.4 | 52 | 57.2 | 68.8 | 6.9 | 51.8 | 38.3 | — | — | — | — | |
| Metamath 7BDecoder Model=Metamath 7B, Group=Open Models2025.09 | 6.4 | 2 | 4.4 | 36.4 | 40.4 | 52.8 | 50.4 | 46 | 58.4 | 63.6 | 4.3 | 49.7 | 36.1 | — | — | — | — | |
| Qwen2.5-3B-Instruct + SFT-TransTestBackbone=Qwen2.5-3B-Instruct, Training Method=SFT-TransTest2026.03 | 2.8 | 10 | 2 | 8.8 | 47.2 | 26 | 29.6 | 23.2 | 28 | 85.6 | — | — | 5 | 1.6 | — | 24.1 | — | |
| LayAlignDecoder Model=Metamath 7B, Multilingual Encoder=mT5-XL2025.09 | 1.6 | 3.6 | 8 | 23.2 | 23.2 | 37.2 | 37.6 | 34.8 | 38.4 | 43.2 | 4.4 | 33.9 | 25.1 | — | — | — | — |