Accuracy on MATH-500
97.6AccuracyLength-based Ranking
Evaluation Results
| Method | Links | |
|---|---|---|
| Length-based RankingModel=DeepSeek-V3.2, API Calls=O(N)2026.01 | 97.6 | |
| Self-ConsistencyModel=DeepSeek-V3.2, API Calls=O(N)2026.01 | 97.2 | |
| Self-VerificationModel=DeepSeek-V3.2, API Calls=O(NL)2026.01 | 97.2 | |
| UniCogModel=DeepSeek-V3.2, API Calls=O(N)2026.01 | 97 | |
| StandardModel=DeepSeek-V3.2, API Calls=O(1)2026.01 | 96.4 | |
| BroRLSampling strategy=@4, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 92.14 | |
| ProRL-V2Sampling strategy=@4, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 92 | |
| JustRL-DeepSeekSampling strategy=@4, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 91.65 | |
| DeepScaleR-1.5BSampling strategy=@4, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 89.3 | |
| DyTopoBackbone=GPT-oss-120B2026.02 | 88.57 | |
| Length-based RankingModel=Qwen3-8B, API Calls=O(N)2026.01 | 88 | |
| Self-ConsistencyModel=Qwen3-8B, API Calls=O(N)2026.01 | 87.8 | |
| Perplexity-based RankingModel=Qwen3-8B, API Calls=O(N)2026.01 | 87.6 | |
| UniCogModel=Qwen3-8B, API Calls=O(N)2026.01 | 87.6 | |
| Self-IndicatorModel=Qwen3-8B, API Calls=O(N)2026.01 | 87.2 | |
| DyTopoBackbone=MiMo-V2-Flash2026.02 | 87.14 | |
| Random TopologyBackbone=GPT-oss-120B2026.02 | 87.14 | |
| Self-VerificationModel=Qwen3-8B, API Calls=O(NL)2026.01 | 86.6 | |
| Backbone (DeepSeek-R1-Distill-Qwen-1.5B)Sampling strategy=@4, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 84.9 | |
| StandardModel=Qwen3-8B, API Calls=O(1)2026.01 | 83 | |
| AgentScopeBackbone=GPT-oss-120B2026.02 | 82.86 | |
| ProFitModel=Qwen3-14B-Base, Evaluation Samples=8 samples2026.01 | 82.85 | |
| DFTModel=Qwen3-14B-Base, Evaluation Samples=8 samples2026.01 | 81.97 | |
| Single-turn AgentBackbone=GPT-oss-120B2026.02 | 81.43 | |
| Dynamic + PRM SelectionBackbone=Qwen-2.5-7B2026.02 | 81.4 | |
| UniCogModel=GPT-4o-0513, API Calls=O(N)2026.01 | 80.2 | |
| EntropyModel=Qwen3-14B-Base, Evaluation Samples=8 samples2026.01 | 80.12 | |
| SFTModel=Qwen3-14B-Base, Evaluation Samples=8 samples2026.01 | 79.22 | |
| Self-ConsistencyModel=GPT-4o-0513, API Calls=O(N)2026.01 | 78.8 | |
| Length-based RankingModel=GPT-4o-0513, API Calls=O(N)2026.01 | 78.8 | |
| Self-VerificationModel=GPT-4o-0513, API Calls=O(NL)2026.01 | 78.8 | |
| Random TopologyBackbone=MiMo-V2-Flash2026.02 | 78.57 | |
| VanillaModel=Qwen3-14B-Base, Evaluation Samples=8 samples2026.01 | 78.32 | |
| ProFitModel=Qwen3-4B-Base, Evaluation Samples=8 samples2026.01 | 77.85 | |
| DFTModel=Qwen3-4B-Base, Evaluation Samples=8 samples2026.01 | 77.5 | |
| AgentScopeBackbone=MiMo-V2-Flash2026.02 | 75.71 | |
| DyTopoBackbone=Qwen3-8B2026.02 | 75.71 | |
| EFFGENBackbone=Qwen2.5-32B-Instruct2026.01 | 75.4 | |
| SFTModel=Qwen3-4B-Base, Evaluation Samples=8 samples2026.01 | 74.8 | |
| EntropyModel=Qwen3-4B-Base, Evaluation Samples=8 samples2026.01 | 74.75 | |
| DynamicBackbone=Qwen-2.5-7B2026.02 | 74.2 | |
| StandardModel=GPT-4o-0513, API Calls=O(1)2026.01 | 73.8 | |
| Raw ModelBackbone=Qwen2.5-32B-Instruct2026.01 | 73 | |
| AgentScopeBackbone=Qwen3-8B2026.02 | 72.86 | |
| AutogenBackbone=Qwen2.5-32B-Instruct2026.01 | 72.8 | |
| Direct + PRM SelectionBackbone=Qwen-2.5-7B2026.02 | 72 | |
| DirectBackbone=Qwen-2.5-7B2026.02 | 71.2 | |
| EFFGENBackbone=Qwen2.5-14B-Instruct2026.01 | 69.6 | |
| Random TopologyBackbone=Qwen3-8B2026.02 | 68.57 | |
| SmolagentsBackbone=Qwen2.5-32B-Instruct2026.01 | 68 | |
| Raw ModelBackbone=Qwen2.5-14B-Instruct2026.01 | 67.8 | |
| EFFGENBackbone=Qwen2.5-7B-Instruct2026.01 | 66.8 | |
| AutogenBackbone=Qwen2.5-14B-Instruct2026.01 | 66 | |
| Raw ModelBackbone=Qwen2.5-7B-Instruct2026.01 | 65.8 | |
| Single-turn AgentBackbone=MiMo-V2-Flash2026.02 | 65.71 | |
| Dynamic + PRM SelectionBackbone=Llama-3.1-8B2026.02 | 65.4 | |
| AutogenBackbone=Qwen2.5-7B-Instruct2026.01 | 64.6 | |
| OSS-Distill-DataBase Model=Llama-3.1-8B-Instruct, Data Size=20K2026.01 | 60.8 | |
| QwQ-Distill-DataBase Model=Llama-3.1-8B-Instruct, Data Size=20K2026.01 | 60.8 | |
| LLM OutputBackbone=GPT-oss-120B2026.02 | 60 | |
| EFFGENBackbone=Qwen2.5-3B-Instruct2026.01 | 59.2 | |
| LangChainBackbone=Qwen2.5-32B-Instruct2026.01 | 59.2 | |
| Self-VerificationModel=LLaMA-3.1-8B, API Calls=O(NL)2026.01 | 57.8 | |
| VanillaModel=Qwen3-4B-Base, Evaluation Samples=8 samples2026.01 | 57.67 | |
| Self-IndicatorModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 57.6 | |
| LLM OutputBackbone=MiMo-V2-Flash2026.02 | 57.14 | |
| Single-turn AgentBackbone=Qwen3-8B2026.02 | 57.14 | |
| UniCogModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 57 | |
| Perplexity-based RankingModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 56.6 | |
| Self-ConsistencyModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 55.2 | |
| Raw ModelBackbone=Qwen2.5-3B-Instruct2026.01 | 55 | |
| Length-based RankingModel=LLaMA-3.1-8B, API Calls=O(N)2026.01 | 54.8 | |
| OSS-Distill-DataBase Model=LLaMA-3.1-8B-Base, Data Size=20K2026.01 | 54.2 | |
| LangChainBackbone=Qwen2.5-14B-Instruct2026.01 | 53.2 | |
| AutogenBackbone=Qwen2.5-3B-Instruct2026.01 | 51.8 | |
| OSS-Mole-SynBase Model=Llama-3.1-8B-Instruct, Data Size=20K2026.01 | 51.8 | |
| QwQ-Mole-SynBase Model=Llama-3.1-8B-Instruct, Data Size=20K2026.01 | 50.2 | |
| ProFitModel=Qwen3-0.6B-Base, Evaluation Samples=8 samples2026.01 | 49.9 | |
| LangChainBackbone=Qwen2.5-3B-Instruct2026.01 | 48.8 | |
| LLM OutputBackbone=Qwen3-8B2026.02 | 48.57 | |
| DFTModel=Qwen3-0.6B-Base, Evaluation Samples=8 samples2026.01 | 47.92 | |
| StandardModel=LLaMA-3.1-8B, API Calls=O(1)2026.01 | 47.2 | |
| DynamicBackbone=Llama-3.1-8B2026.02 | 47.2 | |
| DyTopoBackbone=Llama3-8B-Instruct2026.02 | 47.14 | |
| EntropyModel=Qwen3-0.6B-Base, Evaluation Samples=8 samples2026.01 | 45.83 | |
| SFTModel=Qwen3-0.6B-Base, Evaluation Samples=8 samples2026.01 | 45.38 | |
| Direct + PRM SelectionBackbone=Llama-3.1-8B2026.02 | 44.6 | |
| DirectBackbone=Llama-3.1-8B2026.02 | 43.8 | |
| LangChainBackbone=Qwen2.5-7B-Instruct2026.01 | 41.2 | |
| Qwen-Distill-DataBase Model=Llama-3.1-8B-Instruct, Data Size=20K2026.01 | 39.8 | |
| EFFGENBackbone=Qwen2.5-1.5B-Instruct2026.01 | 36 | |
| OSS-Mole-SynBase Model=LLaMA-3.1-8B-Base, Data Size=20K2026.01 | 35.2 | |
| Llama-3.1-8B-InstructBase Model=Llama-3.1-8B-Instruct2026.01 | 35.2 | |
| QwQ-Mole-SynBase Model=LLaMA-3.1-8B-Base, Data Size=20K2026.01 | 35 | |
| QwQ-Distill-DataBase Model=LLaMA-3.1-8B-Base, Data Size=20K2026.01 | 32.2 | |
| AgentScopeBackbone=Llama3-8B-Instruct2026.02 | 30 | |
| Qwen-Distill-DataBase Model=LLaMA-3.1-8B-Base, Data Size=20K2026.01 | 29.4 | |
| Raw ModelBackbone=Qwen2.5-1.5B-Instruct2026.01 | 28.6 | |
| AutogenBackbone=Qwen2.5-1.5B-Instruct2026.01 | 26.19 | |
| Single-turn AgentBackbone=Llama3-8B-Instruct2026.02 | 25.71 |