Science Reasoning on GPQA
95.1AccuracyM2CL
Evaluation Results
| Method | Links | |
|---|---|---|
| M2CLBackbone=Llama-70B, Number of LLMs=322026.02 | 95.1 | |
| M2CLBackbone=Llama-14B, Number of LLMs=322026.02 | 94.7 | |
| M2CLModel=Llama-70B, Number of LLMs=162026.02 | 91.3 | |
| M2CLModel=Llama-14B, Number of LLMs=162026.02 | 88.5 | |
| Qwen3.5-122B-A10BTool Use=no tools2026.04 | 86.6 | |
| M2CLBackbone=Llama-7B, Number of LLMs=322026.02 | 84.5 | |
| Nemotron 3 SuperTool Use=with tools2026.04 | 82.7 | |
| M2CLBackbone=Qwen-72B, Number of LLMs=322026.02 | 82 | |
| GPT-OSS-120BTool Use=no tools2026.04 | 80.1 | |
| GPT-OSS-120BTool Use=with tools2026.04 | 80.09 | |
| M2CLModel=Qwen-72B, Number of LLMs=162026.02 | 80 | |
| o3-mini-highaccess=API only, examples_for_finetuning=N/A2025.01 | 79.7 | |
| Nemotron 3 SuperTool Use=no tools2026.04 | 79.23 | |
| Thought-ICSModel=OSS-120B2026.02 | 79 | |
| o3-mini-mediumaccess=API only, examples_for_finetuning=N/A2025.01 | 76.8 | |
| M2CLBackbone=Qwen-7B, Number of LLMs=322026.02 | 74.9 | |
| DyLANBackbone=Llama-70B, Number of LLMs=322026.02 | 74.6 | |
| MacNetBackbone=Llama-70B, Number of LLMs=322026.02 | 73.9 | |
| GPTSwarmBackbone=Llama-70B, Number of LLMs=322026.02 | 73.4 | |
| DyLANModel=Llama-70B, Number of LLMs=162026.02 | 73.2 | |
| Thought-ICSModel=LLaMA-70B2026.02 | 73 | |
| M2CLModel=Qwen-7B, Number of LLMs=162026.02 | 72.8 | |
| r1access=Open Weights, examples_for_finetuning=>800K2025.01 | 71.5 | |
| o3-mini-lowaccess=API only, examples_for_finetuning=N/A2025.01 | 70.6 | |
| M2CLBackbone=Qwen-14B, Number of LLMs=322026.02 | 70.5 | |
| M2CLModel=Llama-7B, Number of LLMs=162026.02 | 69.9 | |
| GPTSwarmModel=Llama-70B, Number of LLMs=162026.02 | 69.7 | |
| Token-ICSModel=LLaMA-70B2026.02 | 69 | |
| M2CLModel=Qwen-14B, Number of LLMs=162026.02 | 69 | |
| MacNetModel=Llama-70B, Number of LLMs=162026.02 | 68.3 | |
| Token-ICSModel=Qwen-32B2026.02 | 68 | |
| MacNetBackbone=Llama-14B, Number of LLMs=322026.02 | 67.2 | |
| Thought-ICSModel=Qwen-32B2026.02 | 67 | |
| LIMOaccess=Open Weights and Open Data, examples_for_finetuning=8172025.01 | 66.7 | |
| Thought-ICSModel=Qwen-7B2026.02 | 66 | |
| Thought-ICSModel=Qwen-14B2026.02 | 66 | |
| r1-distill-Llama-70Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 65.2 | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 2x2025.01 | 63.6 | |
| DebateBackbone=Llama-70B, Number of LLMs=322026.02 | 63.4 | |
| Thought-ICSModel=LLaMA-3B2026.02 | 63 | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 1x2025.01 | 62.6 | |
| r1-distill-Qwen-32Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 62.1 | |
| BLASSTModel=Qwen3-8B, Sparsity=~50%, Deployment Phase=Decode Phase2025.12 | 61.56 | |
| BLASSTModel=Qwen3-8B, Sparsity=~75%, Deployment Phase=Decode Phase2025.12 | 61.51 | |
| Dense AttentionModel=Qwen3-8B, Sparsity=Dense, Deployment Phase=Decode Phase2025.12 | 61.21 | |
| s1.1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=None2025.01 | 60.6 | |
| ReasoningGuardBackbone=Qwen3-14B2026.01 | 60.6 | |
| MacNetModel=Llama-14B, Number of LLMs=162026.02 | 59.7 | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 1x2025.01 | 59.6 | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 2x2025.01 | 59.6 | |
| BoNModel=Llama-70B, Number of LLMs=162026.02 | 59.6 | |
| BoNBackbone=Llama-70B, Number of LLMs=322026.02 | 59.6 | |
| ReasoningGuardBackbone=Qwen3-8B2026.01 | 59.6 | |
| r1-distill-Qwen-14Baccess=Open Weights, examples_for_finetuning=800K2025.01 | 59.1 | |
| DIVERBase Model=Qwen2.5-Math-1.5B2025.09 | 59.1 | |
| Thought-ICSModel=OSS-20B2026.02 | 59 | |
| MV@10Model=LLaMA-70B2026.02 | 59 | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=Wait 4x2025.01 | 58.6 | |
| STAR-1Backbone=Qwen3-14B2026.01 | 58.6 | |
| Self-GuardBackbone=Qwen3-14B2026.01 | 58.6 | |
| DebateModel=Llama-70B, Number of LLMs=162026.02 | 58.5 | |
| Thought-ICSModel=LLaMA-8B2026.02 | 58 | |
| AlphaRLBase Model=GLM-4-9B-0414, Stage=20%2025.10 | 57.75 | |
| s1access=Open Weights and Open Data, examples_for_finetuning=1K, budget_forcing=None2025.01 | 56.6 | |
| STAR-1Backbone=Qwen3-8B2026.01 | 56.6 | |
| InstructBackbone=Qwen3-14B2026.01 | 56.6 | |
| Self-ReminderBackbone=Qwen3-14B2026.01 | 56.1 | |
| Token-ICSModel=Qwen-14B2026.02 | 56 | |
| Token-ICSModel=OSS-120B2026.02 | 56 | |
| Standard TrainingBase Model=GLM-4-9B-0414, Stage=Fully Trained2025.10 | 55.67 | |
| AlphaRLBase Model=GLM-4-9B-0414, Stage=50%2025.10 | 55.33 | |
| MacNetBackbone=Qwen-72B, Number of LLMs=322026.02 | 55.2 | |
| SafeKeyBackbone=Qwen3-14B2026.01 | 55.1 | |
| DyLANBackbone=Qwen-72B, Number of LLMs=322026.02 | 54.8 | |
| AlphaRLBase Model=GLM-4-9B-0414, Stage=40%2025.10 | 54.75 | |
| GPTSwarmBackbone=Qwen-72B, Number of LLMs=322026.02 | 54.7 | |
| QwQ-32Baccess=Open Weights, examples_for_finetuning=N.A.2025.01 | 54.5 | |
| InstructBackbone=Qwen3-4B2026.01 | 54.5 | |
| Self-GuardBackbone=Qwen3-8B2026.01 | 54.5 | |
| Standard TrainingBase Model=Qwen3-14B-Base, Stage=Fully Trained2025.10 | 54.5 | |
| Self-ReminderBackbone=Qwen3-8B2026.01 | 54 | |
| AlphaRLBase Model=Qwen3-14B-Base, Stage=50%2025.10 | 53.75 | |
| DyLANModel=Qwen-72B, Number of LLMs=162026.02 | 53.6 | |
| SafeKeyBackbone=Qwen3-8B2026.01 | 53.5 | |
| AlphaRLBase Model=GLM-4-9B-0414, Stage=30%2025.10 | 53.33 | |
| GPTSwarmModel=Qwen-72B, Number of LLMs=162026.02 | 53.3 | |
| AlphaRLBase Model=GLM-4-9B-0414, Stage=10%2025.10 | 53.25 | |
| InitModel=LLaMA-70B2026.02 | 53 | |
| InstructBackbone=Qwen3-8B2026.01 | 53 | |
| SafeChainBackbone=Qwen3-14B2026.01 | 53 | |
| AlphaRLBase Model=Qwen3-14B-Base, Stage=40%2025.10 | 52.59 | |
| RTT-AONBackbone=Qwen3-4B-Instruct2026.04 | 52.01 | |
| Qwen3-4B-InstructBackbone=Qwen3-4B-Instruct2026.04 | 51.79 | |
| AlphaRLBase Model=Qwen3-14B-Base, Stage=30%2025.10 | 51.73 | |
| ReasoningGuardBackbone=Qwen3-4B2026.01 | 51.5 | |
| Self-ReminderBackbone=Qwen3-4B2026.01 | 51.5 | |
| Standard TrainingBase Model=Qwen3-14B-Base, Stage=50%2025.10 | 51.25 | |
| Self-GuardBackbone=Qwen3-4B2026.01 | 50.5 | |
| MacNetBackbone=Llama-7B, Number of LLMs=322026.02 | 50.3 | |
| Standard TrainingBase Model=GLM-4-9B-0414, Stage=50%2025.10 | 50.2 |