Commonsense Reasoning on CSQA (Accuracy)
91.2CSQA AccuracyPrevious SoTA
Evaluation Results
| Method | Links | |
|---|---|---|
| Previous SoTA2022.03 | 91.2 | |
| Weighted MV2026.04 | 87.63 | |
| Simple MV2026.04 | 87.47 | |
| EMS-SimSorting Strategy=Semantic Similarity2026.04 | 87.47 | |
| EMS-RelSorting Strategy=Historical Reliability2026.04 | 87.47 | |
| Conf-MV2026.04 | 87.24 | |
| BEAMModel=Qwen3-30B-A3B, Beta (β)=0.01, Avg. K=4.232026.05 | 86.4 | |
| Qwen3-30B-A3BModel=Qwen3-30B-A3B, Target Top-K (K)=8, Avg. K=8.002026.05 | 86.24 | |
| Self-Consistency2026.04 | 85.88 | |
| CoT-SCBackbone=gpt-4, n=52026.04 | 85.6 | |
| Single Agent2026.04 | 84.95 | |
| CoTBackbone=gpt-42026.04 | 84.9 | |
| CLoTBackbone=gpt-42026.04 | 84.9 | |
| C-CoTBackbone=gpt-42026.04 | 83.9 | |
| CoT-SCBackbone=gpt-4o-mini, n=52026.04 | 83.4 | |
| ISP-CoTBackbone=gpt-42026.04 | 83.4 | |
| LoRABackbone=Qwen2.5-3B2026.02 | 82.8 | |
| CLoTBackbone=deepseek-v32026.04 | 82.6 | |
| HydraLoRABackbone=Qwen2.5-3B2026.02 | 82.56 | |
| MoSLoRABackbone=Qwen2.5-3B2026.02 | 82.47 | |
| CLoTBackbone=gpt-4o-mini2026.04 | 82.3 | |
| CoT-SCBackbone=deepseek-v3, n=52026.04 | 82.2 | |
| ISP-CoTBackbone=gpt-4o-mini2026.04 | 81.9 | |
| Self-consistencyModel=GPT-3 (Code-davinci-002)2022.03 | 81.5 | |
| CoTBackbone=gpt-4o-mini2026.04 | 81.5 | |
| ExGRPOModel=Qwen2.5-7B-Instruct, Model Role=Student Model, Adapter=On-Policy Adapt.2026.02 | 81.45 | |
| Qwen1.5-MoEModel=Qwen1.5-MoE-A2.7B, Target Top-K (K)=4, Avg. K=4.002026.05 | 81.33 | |
| C-CoTBackbone=deepseek-v32026.04 | 81.2 | |
| CoTBackbone=deepseek-v32026.04 | 81.1 | |
| C-CoTBackbone=gpt-4o-mini2026.04 | 81 | |
| ARBackbone=deepseek-v32026.04 | 81 | |
| ExGRPOModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 80.85 | |
| BEAMModel=Qwen1.5-MoE-A2.7B, Beta (β)=0.01, Avg. K=1.562026.05 | 80.84 | |
| Self-consistencyModel=PaLM-540B2022.03 | 80.7 | |
| HypLoRABackbone=Qwen2.5-3B2026.02 | 79.85 | |
| Few-ShotPrompting=Few-shot2022.10 | 79.5 | |
| TrBackbone=gpt-42026.04 | 79.4 | |
| ARBackbone=gpt-42026.04 | 79.1 | |
| On-Policy DistillationModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 79.05 | |
| CoT-promptingModel=PaLM-540B2022.03 | 79 | |
| CoT-promptingModel=GPT-3 (Code-davinci-002)2022.03 | 79 | |
| Zero-shot-EIModel=Gemini-1.5-Pro, Model Role=Teacher Model2026.02 | 78.78 | |
| ARBackbone=gpt-4o-mini2026.04 | 78.7 | |
| RevThinkModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 78.45 | |
| DARBackbone Model=Falcon3-7B, Number of Agents=4, Number of Rounds=22026.03 | 78.3 | |
| Uncertain PromptBackbone Model=Falcon3-7B, Number of Agents=4, Number of Rounds=22026.03 | 78.2 | |
| MAD-M2Model=Falcon3-7B2026.03 | 78.1 | |
| Zero-shotModel=Gemini-1.5-Pro, Model Role=Teacher Model2026.02 | 77.9 | |
| Society Of MindModel=Falcon3-7B2026.03 | 77.8 | |
| DARModel=Falcon3-7B2026.03 | 77.8 | |
| Society Of MindBackbone Model=Falcon3-7B, Number of Agents=4, Number of Rounds=22026.03 | 77.8 | |
| MAD-M^2Backbone Model=Falcon3-7B, Number of Agents=4, Number of Rounds=22026.03 | 77.7 | |
| ReSTEMBackbone=Qwen2.5-1.5B, Training Iterations=12026.05 | 77.64 | |
| Uncertain PromptModel=Falcon3-7B2026.03 | 77.6 | |
| Vote PromptModel=Falcon3-7B2026.03 | 77.6 | |
| Vote PromptBackbone Model=Falcon3-7B, Number of Agents=4, Number of Rounds=22026.03 | 77.6 | |
| ZS-CoT (teacher)Model=GPT-4o-mini, #Params=-2026.05 | 77.6 | |
| Divide-or-ConquerModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 77.42 | |
| ExGRPOModel=Gemma-7B-it, Model Role=Student Model, Adapter=On-Policy Adapt.2026.02 | 77.42 | |
| Answer AugModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 77.36 | |
| ExGRPOModel=Gemma-7B-it, Model Role=Student Model2026.02 | 76.82 | |
| ZS-CoT (teacher)Model=GPT-4o-mini, #Params=-2026.05 | 76.8 | |
| Majority VoteModel=Falcon3-7B2026.03 | 76.7 | |
| Question AugModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 76.4 | |
| Majority VoteBackbone Model=Falcon3-7B, Number of Agents=4, Number of Rounds=22026.03 | 76.4 | |
| Rephrase QuestionModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 75.18 | |
| Single-agentModel=Falcon3-7B2026.03 | 75 | |
| Single-agentBackbone Model=Falcon3-7B2026.03 | 75 | |
| RevThinkModel=Gemma-7B-it, Model Role=Student Model2026.02 | 74.53 | |
| Auto-CoTPrompting=Automatic Chain-of-Thought2022.10 | 74.4 | |
| Distill Step-by-StepModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 74.33 | |
| SFT-OracleBackbone=Qwen2.5-1.5B, Training Iterations=12026.05 | 74.2 | |
| On-Policy DistillationModel=Gemma-7B-it, Model Role=Student Model2026.02 | 74.12 | |
| Manual-CoTPrompting=Manual Chain-of-Thought2022.10 | 73.5 | |
| SKDModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 73.12 | |
| Distill Step-by-StepModel=Gemma-7B-it, Model Role=Student Model2026.02 | 73.01 | |
| Answer AugModel=Gemma-7B-it, Model Role=Student Model2026.02 | 73.01 | |
| Zero-ShotPrompting=Zero-shot2022.10 | 72.6 | |
| SKDModel=Gemma-7B-it, Model Role=Student Model2026.02 | 72.48 | |
| HSIR-SFTBackbone=Qwen2.5-1.5B, Training Iterations=12026.05 | 72.48 | |
| MAD-M^2Backbone Model=Qwen2.5-3B, Number of Agents=4, Number of Rounds=22026.03 | 72.4 | |
| DARModel=Qwen2.5-3B2026.03 | 71.8 | |
| Society Of MindModel=Qwen2.5-3B2026.03 | 71.4 | |
| Zero-shotModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 71.33 | |
| Majority VoteModel=Qwen2.5-3B2026.03 | 71.3 | |
| MAD-M2Model=Qwen2.5-3B2026.03 | 71.2 | |
| Majority VoteBackbone Model=Qwen2.5-3B, Number of Agents=4, Number of Rounds=22026.03 | 71.2 | |
| Vanilla-KDModel=FlanT5-large, #Params=780M2026.05 | 71.2 | |
| Society Of MindBackbone Model=Qwen2.5-3B, Number of Agents=4, Number of Rounds=22026.03 | 71 | |
| DARBackbone Model=Llama3.1-8B, Number of Agents=4, Number of Rounds=22026.03 | 70.8 | |
| Uncertain PromptBackbone Model=Qwen2.5-3B, Number of Agents=4, Number of Rounds=22026.03 | 70.7 | |
| Vote PromptModel=Qwen2.5-3B2026.03 | 70.6 | |
| DARBackbone Model=Qwen2.5-3B, Number of Agents=4, Number of Rounds=22026.03 | 70.6 | |
| Vote PromptBackbone Model=Qwen2.5-3B, Number of Agents=4, Number of Rounds=22026.03 | 70.4 | |
| Rephrase QuestionModel=Gemma-7B-it, Model Role=Student Model2026.02 | 70.22 | |
| Uncertain PromptModel=Qwen2.5-3B2026.03 | 70.2 | |
| Divide-or-ConquerModel=Gemma-7B-it, Model Role=Student Model2026.02 | 70.15 | |
| GateKDModel=FlanT5-base, #Params=250M2026.05 | 69.5 | |
| Vanilla-KDModel=T5-large, #Params=780M2026.05 | 69.3 | |
| Single-agentModel=Qwen2.5-3B2026.03 | 69.2 |