Mathematical Reasoning on MGSM (test)
88Accuracy (ZH)self-cons
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| self-consBackbone=Qwen-2.5 14B IT, Strategy=cross-lingual self-consistency2026.05 | 88 | — | — | — | — | 88.4 | — | 88.4 | 87.8 | 65.6 | 89.2 | 82.2 | 80.8 | 49.6 | 81.6 | 76.9 | 44.6 | |
| DARE MergingSetting=Ability Transfer, SFT=false2026.01 | 86 | — | — | — | — | 91.2 | 88.6 | — | — | — | — | — | — | — | — | — | — | |
| LIDRBackbone=Qwen-2.5 14B IT, Strategy=DPO2026.05 | 86 | — | — | — | — | 87.6 | — | 66.8 | 81.2 | 54 | 71.2 | 65.2 | 51.6 | 50.8 | 69.8 | 65.7 | 38.6 | |
| Task ArithmeticSetting=Ability Transfer, SFT=false2026.01 | 85.6 | — | — | — | — | 89.6 | 87.6 | — | — | — | — | — | — | — | — | — | — | |
| S1Backbone=Qwen-2.5 14B IT, Strategy=test-time scaling2026.05 | 85.2 | — | — | — | — | 90.4 | — | 89.2 | 86.8 | 60.4 | 86.4 | 80.4 | 80.8 | 54 | 76 | 75.6 | 40.4 | |
| ACTSetting=Ability Transfer (transfer-only), SFT=false2026.01 | 84.8 | — | — | — | — | 90 | 87.4 | — | — | — | — | — | — | — | — | — | — | |
| TIES MergingSetting=Ability Transfer, SFT=false2026.01 | 84.4 | — | — | — | — | 92.4 | 88.4 | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-7B Math InstructSetting=Multi-lingual LLM Baseline2026.01 | 84 | — | — | — | — | 92.4 | 88.2 | — | — | — | — | — | — | — | — | — | — | |
| trans-testBackbone=Qwen-2.5 14B IT, Strategy=translate-test2026.05 | 82.3 | — | — | — | — | 84.2 | — | 49.2 | 70.4 | 33.4 | 66 | 57.3 | 53.2 | 41.4 | 70.2 | 57.6 | 26.2 | |
| Qwen-2.5 14B ITBackbone=Qwen-2.5 14B IT, Strategy=native-cot2026.05 | 80.8 | — | — | — | — | 84.2 | — | 44 | 75.2 | 37.6 | 61.6 | 48.8 | 47.2 | 40.4 | 66 | 55.2 | 21.8 | |
| Task ArithmeticSetting=With supervised fine-tuning, SFT=true2026.01 | 79.6 | — | — | — | — | 88.4 | 84 | — | — | — | — | — | — | — | — | — | — | |
| ACTSetting=With supervised fine-tuning, SFT=true2026.01 | 79.6 | — | — | — | — | 90.4 | 85 | — | — | — | — | — | — | — | — | — | — | |
| TIES MergingSetting=With supervised fine-tuning, SFT=true2026.01 | 75.6 | — | — | — | — | 88.4 | 82 | — | — | — | — | — | — | — | — | — | — | |
| SFTSetting=With supervised fine-tuning, SFT=true2026.01 | 74.8 | — | — | — | — | 87.6 | 81.2 | — | — | — | — | — | — | — | — | — | — | |
| DARE MergingSetting=With supervised fine-tuning, SFT=true2026.01 | 74.8 | — | — | — | — | 88.8 | 81.8 | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-7B InstructSetting=Multi-lingual LLM Baseline2026.01 | 74 | — | — | — | — | 82 | 78 | — | — | — | — | — | — | — | — | — | — | |
| XBridge_LLMBase Model=Qwen2.5-7B-Instruct, reasoning_output=English (LLM)2026.03 | 71.6 | — | — | — | — | 83.6 | — | 74 | 77.2 | 63.2 | 74.4 | 72.8 | 65.2 | 67.6 | 68.4 | 71.8 | — | |
| XBridge_DecBase Model=Qwen2.5-7B-Instruct, reasoning_output=multilingual (external decoder)2026.03 | 70.4 | — | — | — | — | 83.2 | — | 72.4 | 76 | 60.8 | 72.4 | 65.6 | 59.2 | 66.8 | 64 | 69.08 | — | |
| LiRA-LARGEPARAMS=15.9B, YEAR=OURS2025.10 | 70.3 | — | — | — | — | 79.2 | — | 73.9 | 75 | 69.6 | 69.3 | 69.8 | 69.1 | 61.9 | 72.5 | 71.1 | — | |
| MindMergerBase Model=Qwen2.5-7B-Instruct2026.03 | 70 | — | — | — | — | 83.6 | — | 77.2 | 76.4 | 60.4 | 71.6 | 73.6 | 64.8 | 65.2 | 66.4 | 70.92 | — | |
| LayerAlignBase Model=Qwen2.5-7B-Instruct2026.03 | 68.8 | — | — | — | — | 83.2 | — | 74.4 | 78.4 | 65.6 | 75.2 | 74 | 62.8 | 66.8 | 65.6 | 71.48 | — | |
| self-consBackbone=Llama3 8B-IT2026.05 | 68.4 | — | — | — | — | 82.4 | — | 69.6 | 74.8 | 64.4 | 76.4 | 72 | 57.2 | 59.2 | 41.6 | 65.5 | — | |
| QWEN3-8BPARAMS=8B, YEAR=20252025.10 | 67.9 | — | — | — | — | 78.9 | — | 72.5 | 75.1 | 66.4 | 71 | 69.3 | 64.5 | 59.1 | 69.3 | 69.4 | — | |
| SFTBase Model=Qwen2.5-7B-Instruct2026.03 | 67.6 | — | — | — | — | 66.4 | — | 60 | 59.6 | 49.6 | 64 | 58.4 | 54.4 | 48.4 | 62.8 | 59.12 | — | |
| Translate-TestBase Model=Qwen2.5-7B-Instruct2026.03 | 62.8 | — | — | — | — | 74.4 | — | 63.2 | 62.4 | 43.2 | 67.6 | 60.4 | 59.6 | 58.4 | 44 | 59.6 | — | |
| S1Backbone=Qwen-2.5 7B IT, Strategy=test-time scaling2026.05 | 60.4 | — | — | — | — | 88.2 | — | 72.4 | 66.4 | 50 | 63.6 | 70 | 63.2 | 8.8 | 64.4 | 55.9 | 15.6 | |
| LIDRBackbone=Qwen-2.5 7B IT, Strategy=DPO2026.05 | 60 | — | — | — | — | 79.6 | — | 55.2 | 60.4 | 51.2 | 68.8 | 66.4 | 60.4 | 25.2 | 56 | 54.6 | 17.2 | |
| self-consBackbone=Qwen-2.5 7B IT, Strategy=cross-lingual self-consistency2026.05 | 59.6 | — | — | — | — | 81.8 | — | 76 | 72.4 | 54.8 | 75.2 | 71.6 | 55.6 | 17.6 | 73.2 | 59.3 | 24 | |
| MAPO-13BBackbone=Llama2-13B2026.05 | 59.6 | — | — | — | — | 71.6 | — | 59.3 | 62.8 | 44.8 | 59.2 | 63.6 | 56 | 55.2 | 47.6 | 58 | — | |
| LIDRBackbone=Llama3 8B-IT2026.05 | 59.2 | — | — | — | — | 72 | — | 62 | 64 | 47.2 | 57 | 60.8 | 47.6 | 32.8 | 53.6 | 55.6 | — | |
| LoRAFlowBase LLM=LLaMA-3-8B, Paradigm=Supervised2025.12 | 56.8 | — | — | 62.1 | — | — | — | 60.4 | 69.2 | — | — | — | — | — | — | — | — | |
| XBridge_LLMBase Model=LLaMA3-8B, reasoning_output=English (LLM)2026.03 | 56.4 | — | — | — | — | 65.2 | — | 60.4 | 62 | 47.2 | 59.2 | 62 | 50.8 | 49.6 | 54.4 | 56.72 | — | |
| LIDRBackbone=Qwen-2.5 1.5B IT, Strategy=DPO2026.05 | 55.6 | — | — | — | — | 57.6 | — | 55.6 | 54.4 | 18 | 52 | 54 | 39.6 | 8.4 | 37.2 | 39.9 | 6.4 | |
| XBridge_DecBase Model=LLaMA3-8B, reasoning_output=multilingual (external decoder)2026.03 | 55.2 | — | — | — | — | 62.8 | — | 58.4 | 61.2 | 46 | 56.8 | 57.2 | 46.4 | 49.6 | 51.2 | 54.48 | — | |
| MULTIREASON-LORAPARAMS=7B, YEAR=20222025.10 | 54.8 | — | — | — | — | 64.8 | — | 62.4 | 59.6 | 29.6 | 59.6 | 58.4 | 52 | 28 | 35.2 | 50.4 | — | |
| MINDMERGER-HARDPARAMS=10.7B, YEAR=20242025.10 | 54.4 | — | — | — | — | 71.2 | — | 60.4 | 62 | 46 | 60.4 | 56 | 52.4 | 48.4 | 36 | 54.7 | — | |
| self-consBackbone=Qwen-2.5 1.5B IT, Strategy=cross-lingual self-consistency2026.05 | 54 | — | — | — | — | 50.3 | — | 55.2 | 63.2 | 21.2 | 53.6 | 56.4 | 36 | 5.2 | 48 | 40.9 | 7.2 | |
| MAPOBackbone=Llama3 8B-IT2026.05 | 54 | — | — | — | — | 71.6 | — | 62 | 62.8 | 38.4 | 50.8 | 59.2 | 38.4 | 30.8 | 47.2 | 51.5 | — | |
| MINDMERGER-SOFTPARAMS=10.7B, YEAR=20242025.10 | 53.6 | — | — | — | — | 66.8 | — | 60.8 | 58.4 | 50.4 | 61.2 | 57.6 | 54.4 | 57.2 | 52.8 | 57.3 | — | |
| MetaMathOctopus-13BBackbone=Llama2-13B2026.05 | 53.1 | — | — | — | — | 66.8 | — | 59.1 | 61.1 | 41.6 | 60.1 | 60.8 | 57.3 | 50.9 | 52.1 | 51.5 | — | |
| XBridge_LLMBase Model=MetaMath-7B, reasoning_output=English (LLM)2026.03 | 52.8 | — | — | — | — | 67.2 | — | 57.6 | 60.8 | 48.4 | 54.8 | 57.2 | 47.2 | 46.4 | 45.6 | 53.8 | — | |
| LayerAlignBase Model=LLaMA3-8B2026.03 | 52.8 | — | — | — | — | 62.4 | — | 56.8 | 60.4 | 50 | 56 | 57.6 | 50 | 47.6 | 48.8 | 54.24 | — | |
| trans-testBackbone=Qwen-2.5 7B IT, Strategy=translate-test2026.05 | 52.6 | — | — | — | — | 78.6 | — | 39.2 | 50.3 | 33.4 | 67.6 | 54.4 | 43.6 | 11.4 | 60.2 | 46.4 | 18.6 | |
| XBridge_DecBase Model=MetaMath-7B, reasoning_output=multilingual (external decoder)2026.03 | 52 | — | — | — | — | 66.8 | — | 56 | 60 | 47.2 | 52.8 | 51.6 | 44.8 | 45.6 | 44.4 | 52.12 | — | |
| LayerAlignBase Model=MetaMath-7B2026.03 | 51.2 | — | — | — | — | 62.8 | — | 56.4 | 59.2 | 40.4 | 54.8 | 52.4 | 51.6 | 53.2 | 47.2 | 52.92 | — | |
| MathOctopus-13BBackbone=Llama2-13B2026.05 | 51.2 | — | — | — | — | 51.6 | — | 47.6 | 53.2 | 42 | 49.2 | 49.6 | 39.6 | 46 | 46 | 47.6 | — | |
| MindMergerBase Model=LLaMA3-8B2026.03 | 50.8 | — | — | — | — | 60 | — | 55.2 | 56.8 | 49.6 | 54.8 | 55.6 | 50 | 48 | 46.4 | 52.72 | — | |
| Translate-TestBase Model=Aya-23-8B2026.03 | 50.8 | — | — | — | — | 57.2 | — | 50.4 | 48.4 | 34 | 50 | 45.6 | 42.8 | 43.6 | 33.2 | 45.6 | — | |
| qa-FLoRABase LLM=LLaMA-3-8B, Paradigm=Data & Training free2025.12 | 50.4 | — | — | 58.3 | — | — | — | 58.4 | 66 | — | — | — | — | — | — | — | — | |
| S1Backbone=Qwen-2.5 1.5B IT, Strategy=test-time scaling2026.05 | 50.4 | — | — | — | — | 54.1 | — | 50 | 57.2 | 17.2 | 47.6 | 52.8 | 32.8 | 6 | 40.7 | 37.6 | 4.4 | |
| Llama3 8B-ITBackbone=Llama3 8B-IT2026.05 | 49.6 | — | — | — | — | 73.2 | — | 58.8 | 64.4 | 42.4 | 58.8 | 57.2 | 40.8 | 31.6 | 35.6 | 51.2 | — | |
| SFTBase Model=LLaMA3-8B2026.03 | 49.2 | — | — | — | — | 54 | — | 45.2 | 54.8 | 38.8 | 46.4 | 44.4 | 38.8 | 40.8 | 44 | 45.64 | — | |
| Qwen-2.5 7B ITBackbone=Qwen-2.5 7B IT, Strategy=native-cot2026.05 | 49.2 | — | — | — | — | 78.6 | — | 37.4 | 40.2 | 30 | 60.4 | 48.2 | 49.8 | 19.8 | 54.8 | 44.2 | 18.2 | |
| MindMergerBase Model=MetaMath-7B2026.03 | 48.8 | — | — | — | — | 67.2 | — | 57.6 | 59.2 | 43.6 | 57.2 | 60 | 45.6 | 49.2 | 42.4 | 53.08 | — | |
| Llama2-13BBackbone=Llama2-13B2026.05 | 48.8 | — | — | — | — | 53.2 | — | 47.6 | 48 | 35.2 | 44.4 | 48.4 | 43.2 | 42.8 | 46.8 | 45.8 | — | |
| QALIGNPARAMS=7B, YEAR=20242025.10 | 48.4 | — | — | — | — | 68 | — | 52.4 | 59.6 | 39.6 | 54.8 | 56.8 | 44 | 44 | 40.4 | 49.6 | — | |
| Translate-TestBase Model=LLaMA3-8B2026.03 | 48 | — | — | — | — | 62 | — | 57.2 | 54.8 | 40.4 | 56 | 54.8 | 51.6 | 46.8 | 35.2 | 50.68 | — | |
| TRANSLATE-ENPARAMS=3.3B, YEAR=20232025.10 | 46.8 | — | — | — | — | 65.5 | — | 47.6 | 59.6 | 48.4 | 60.4 | 56.4 | 49.2 | 37.6 | 37.6 | 50.6 | — | |
| Translate-TestBase Model=MetaMath-7B2026.03 | 46 | — | — | — | — | 53.2 | — | 49.2 | 47.6 | 34.8 | 49.2 | 40.8 | 45.2 | 43.2 | 32.4 | 44.16 | — | |
| LayerAlignBase Model=Aya-23-8B2026.03 | 46 | — | — | — | — | 49.2 | — | 46.8 | 48.8 | 41.6 | 45.2 | 48.4 | 44 | 41.2 | 37.6 | 44.88 | — | |
| XBridge_LLMBase Model=Aya-23-8B, reasoning_output=English (LLM)2026.03 | 46 | — | — | — | — | 56.8 | — | 49.2 | 53.2 | 44.4 | 49.2 | 50 | 47.2 | 44.8 | 37.6 | 47.84 | — | |
| LANGBRIDGEPARAMS=7B, YEAR=20242025.10 | 45.2 | — | — | — | — | 63.2 | — | 52.4 | 58 | 42.8 | 56.4 | 50.8 | 40 | 43.2 | 50.4 | 50.2 | — | |
| MathOctopus-7BBackbone=Llama2-7B2026.05 | 45.2 | — | — | — | — | 54.8 | — | 48.4 | 45.2 | 33.2 | 43.6 | 38 | 35.6 | 38.4 | 36.4 | 41.9 | — | |
| XBridge_DecBase Model=Aya-23-8B, reasoning_output=multilingual (external decoder)2026.03 | 44 | — | — | — | — | 56.8 | — | 49.2 | 53.2 | 44.8 | 46.4 | 46.4 | 46.4 | 44.8 | 34 | 46.6 | — | |
| INCLINE-7BBackbone=Llama2-7B2026.05 | 42.8 | — | — | — | — | 46.8 | — | 38 | 45.2 | 48.4 | 51.2 | 37.6 | 44.8 | 38.8 | 43.2 | 43.7 | — | |
| SFTBase Model=Aya-23-8B2026.03 | 42 | — | — | — | — | 50.8 | — | 46.4 | 47.6 | 33.6 | 52.8 | 43.6 | 46.4 | 38.8 | 39.2 | 44.12 | — | |
| MULTIREASON-SFTPARAMS=7B, YEAR=20242025.10 | 42 | — | — | — | — | 52 | — | 45.2 | 48 | 33.2 | 45.2 | 44.8 | 42 | 42 | 40 | 43.4 | — | |
| Qwen-2.5 1.5B ITBackbone=Qwen-2.5 1.5B IT, Strategy=native-cot2026.05 | 41.2 | — | — | — | — | 52.4 | — | 46.5 | 48.8 | 12 | 41.2 | 48.1 | 31.6 | 2.8 | 34.6 | 33.1 | 4.4 | |
| Avg [0.5, 0.5]Base LLM=LLaMA-3-8B, Paradigm=Static fusion2025.12 | 40.8 | — | — | 45.1 | — | — | — | 45.2 | 49.2 | — | — | — | — | — | — | — | — | |
| trans-testBackbone=Qwen-2.5 1.5B IT, Strategy=translate-test2026.05 | 40.8 | — | — | — | — | 52.4 | — | 38.8 | 50 | 14.4 | 44.2 | 42.1 | 23.6 | 8.4 | 36.8 | 33.4 | 12.4 | |
| MindMergerBase Model=Aya-23-8B2026.03 | 40.4 | — | — | — | — | 48 | — | 48 | 48 | 40.8 | 49.6 | 46 | 42.4 | 42.4 | 33.6 | 43.92 | — | |
| MONOREASONPARAMS=7B, YEAR=20242025.10 | 38.4 | — | — | — | — | 68.8 | — | 52 | 57.2 | 6.8 | 55.2 | 54.4 | 36.4 | 6.8 | 7.2 | 38.3 | — | |
| SFTBase Model=MetaMath-7B2026.03 | 36 | — | — | — | — | 48 | — | 39.6 | 39.6 | 30 | 40.4 | 39.2 | 32.4 | 35.2 | 32.8 | 37.32 | — | |
| Centroid sim.Base LLM=LLaMA-3-8B, Paradigm=Training free2025.12 | 34.4 | — | — | 40.5 | — | — | — | 41.6 | 45.6 | — | — | — | — | — | — | — | — | |
| LoRAFlowBase LLM=LLaMA-2-7B, Paradigm=Supervised2025.12 | 33.2 | — | — | 37.6 | — | — | — | 37.6 | 42 | — | — | — | — | — | — | — | — | |
| Llama2-7BBackbone=Llama2-7B2026.05 | 31.6 | — | — | — | — | 52 | — | 33.6 | 39.2 | 18.8 | 38 | 36.4 | 27.2 | 23.6 | 21.6 | 32.2 | — | |
| qa-FLoRABase LLM=LLaMA-2-7B, Paradigm=Data & Training free2025.12 | 21.6 | — | — | 26.5 | — | — | — | 21.6 | 36.4 | — | — | — | — | — | — | — | — | |
| LoRAHubBase LLM=LLaMA-2-7B, Paradigm=Supervised2025.12 | 20.8 | — | — | 28.7 | — | — | — | 28.4 | 36.8 | — | — | — | — | — | — | — | — | |
| Avg [0.5, 0.5]Base LLM=LLaMA-2-7B, Paradigm=Static fusion2025.12 | 12.8 | — | — | 13.9 | — | — | — | 10.4 | 18.4 | — | — | — | — | — | — | — | — | |
| Centroid sim.Base LLM=LLaMA-2-7B, Paradigm=Training free2025.12 | 8.4 | — | — | 10.1 | — | — | — | 4.4 | 17.6 | — | — | — | — | — | — | — | — | |
| CLPBackbone=Llama2-7B, Training Mode=Non-Fine-Tuned2025.02 | — | — | — | 48.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CodeLlama-7B (+ SC)Backbone=CodeLlama-7B, Training Mode=Fine-tuned, Setting=Cross-lingual, Test-time Scaling=Self-Consistency (SC)2025.02 | — | — | — | 46.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CodeLlama-7B (+ SC)Backbone=CodeLlama-7B, Training Mode=Fine-tuned, Setting=Multilingual, Strategy=PoT Parallel + SC2025.02 | — | — | — | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CodeLlama-7B (+ Soft-SC (ICE-Score))Backbone=CodeLlama-7B, Training Mode=Fine-tuned, Setting=Cross-lingual, Test-time Scaling=Soft-SC, Scoring=ICE-Score2025.02 | — | — | — | 61.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CodeLlama-7B (+ Soft-SC (ICE-Score))Backbone=CodeLlama-7B, Training Mode=Fine-tuned, Setting=Multilingual, Strategy=PoT Parallel + Soft-SC, Scoring=ICE-Score2025.02 | — | — | — | 75.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CodeLlama-7B (PoT Parallel)Backbone=CodeLlama-7B, Training Mode=Fine-tuned, Setting=Multilingual, Strategy=PoT Parallel2025.02 | — | — | — | 49 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CodeLlama-7B (Without Comments)Backbone=CodeLlama-7B, Training Mode=Fine-tuned, Setting=Cross-lingual, Prompting=Without Comments2025.02 | — | — | — | 38.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cross-PALBackbone=Llama2-7B, Training Mode=Non-Fine-Tuned2025.02 | — | — | — | 49.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Flan-PaLMPrompting=8-shot Chain-of-thought2023.05 | — | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Flan-PaLM 2Prompting=8-shot Chain-of-thought, Self-consistency=True, Config=In-language exemplars2023.05 | — | 75.9 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IFalpha=0.5, Merge Strategy=TIES-merging, Use DARE=false2024.10 | — | — | — | 7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama2-7B (+ SC)Backbone=Llama2-7B, Training Mode=Fine-tuned, Setting=Multilingual, Strategy=PoT Parallel + SC2025.02 | — | — | — | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama2-7B (+ Soft-SC (ICE-Score))Backbone=Llama2-7B, Training Mode=Fine-tuned, Setting=Cross-lingual, Test-time Scaling=Soft-SC, Scoring=ICE-Score2025.02 | — | — | — | 56.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama2-7B (+ Soft-SC (ICE-Score))Backbone=Llama2-7B, Training Mode=Fine-tuned, Setting=Multilingual, Strategy=PoT Parallel + Soft-SC, Scoring=ICE-Score2025.02 | — | — | — | 71.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama2-7B (PoT Parallel)Backbone=Llama2-7B, Training Mode=Fine-tuned, Setting=Multilingual, Strategy=PoT Parallel2025.02 | — | — | — | 44.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama2-7B (Without Comments)Backbone=Llama2-7B, Training Mode=Fine-tuned, Setting=Cross-lingual, Prompting=Without Comments2025.02 | — | — | — | 39.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MERGEPRINTalpha=0.7, Merge Strategy=Task Arithmetic, Use DARE=true2024.10 | — | — | — | 42 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MERGEPRINTalpha=0.9, Merge Strategy=TIES-merging, Use DARE=false2024.10 | — | — | — | 3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PaLMPrompting=8-shot Chain-of-thought, Self-consistency=True2023.05 | — | 45.9 | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PaLM 2Prompting=8-shot Chain-of-thought, Self-consistency=True, Config=In-language exemplars2023.05 | — | 72.2 | 87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — |