Accuracy on BBH General Reasoning
93.2AccuracySABA
Evaluation Results
| Method | Links | |
|---|---|---|
| SABANormalized inference cost (T)=9.22026.04 | 93.2 | |
| BaseModel=Qwen3-4B2026.05 | 92 | |
| COSEModel=Qwen3-0.6B2026.05 | 91.85 | |
| COSEModel=Llama-3.2-3B-Instruct2026.05 | 91.51 | |
| COSEModel=Qwen3-4B2026.05 | 91.29 | |
| SELF-DISC.Normalized inference cost (T)=5.02026.04 | 91 | |
| MAEModel=Qwen3-4B2026.05 | 90.8 | |
| S^2RNormalized inference cost (T)=18.42026.04 | 90.7 | |
| GoTNormalized inference cost (T)=35.72026.04 | 90.7 | |
| AZRModel=Qwen3-4B2026.05 | 90.6 | |
| R-ZeroModel=Qwen3-4B2026.05 | 90.3 | |
| SC(k=5)Normalized inference cost (T)=12.0, k=52026.04 | 89.6 | |
| CAP-CoTBackbone=GPT-4o2026.04 | 89.1 | |
| GPT-4-06132026.05 | 89.1 | |
| CRITICNormalized inference cost (T)=29.32026.04 | 88 | |
| MAEModel=Llama-3.2-3B-Instruct2026.05 | 88 | |
| CAP-CoTBackbone=GPT-4o-mini2026.04 | 87.9 | |
| CAP-CoTBackbone=Deepseek-V32026.04 | 87.8 | |
| Self-RefineNormalized inference cost (T)=6.32026.04 | 87.3 | |
| AoTBackbone=GPT-4o2026.04 | 87.2 | |
| CAP-CoTBackbone=Qwen-turbo2026.04 | 87.1 | |
| GoTBackbone=GPT-4o2026.04 | 87 | |
| ECONBackbone=GPT-4o2026.04 | 86.9 | |
| GoTBackbone=Deepseek-V32026.04 | 86.2 | |
| MADBackbone=GPT-4o2026.04 | 86.2 | |
| AoTBackbone=Deepseek-V32026.04 | 86.1 | |
| CoTNormalized inference cost (T)=2.52026.04 | 86 | |
| ECONBackbone=GPT-4o-mini2026.04 | 86 | |
| AoTBackbone=GPT-4o-mini2026.04 | 86 | |
| ToTBackbone=GPT-4o-mini2026.04 | 85.9 | |
| InfiGFusionModel Size=14B, GPU Hour=1952025.05 | 85.62 | |
| ECONBackbone=Deepseek-V32026.04 | 85.5 | |
| ToTBackbone=GPT-4o2026.04 | 85.5 | |
| AoTBackbone=Qwen-turbo2026.04 | 85.4 | |
| MADBackbone=GPT-4o-mini2026.04 | 85.2 | |
| GoTBackbone=Qwen-turbo2026.04 | 84.9 | |
| MADBackbone=Deepseek-V32026.04 | 84.8 | |
| CoT-SCBackbone=GPT-4o2026.04 | 84.5 | |
| ECONBackbone=Qwen-turbo2026.04 | 84.4 | |
| ToTBackbone=Deepseek-V32026.04 | 84.4 | |
| GoTBackbone=GPT-4o-mini2026.04 | 84.1 | |
| ToTBackbone=Qwen-turbo2026.04 | 83.7 | |
| CoT-SCBackbone=Deepseek-V32026.04 | 83.6 | |
| MADBackbone=Qwen-turbo2026.04 | 83.5 | |
| FoTBackbone=GPT-4o2026.04 | 83.5 | |
| CoT-SCBackbone=GPT-4o-mini2026.04 | 83.4 | |
| FuseChatModel Size=14B, GPU Hour=6502025.05 | 83.37 | |
| CoT-SCBackbone=Qwen-turbo2026.04 | 83.2 | |
| TDA-RCBase LLM=DeepSeek-V32026.03 | 82.9 | |
| MiniLogitModel Size=14B, GPU Hour=2202025.05 | 82.68 | |
| FoTBackbone=Deepseek-V32026.04 | 82.6 | |
| TDA-RCBase LLM=GPT-4o-mini2026.03 | 82.5 | |
| PromptAgentBackbone=GPT-4o2026.04 | 82.5 | |
| FoTBackbone=GPT-4o-mini2026.04 | 82.4 | |
| FoTBackbone=Qwen-turbo2026.04 | 82.3 | |
| TDA-RCBase LLM=Qwen-Turbo2026.03 | 82.2 | |
| CCoTBackbone=GPT-4o2026.04 | 81.9 | |
| Self-RefineBackbone=GPT-4o2026.04 | 81.6 | |
| Mistral-SmallModel Size=24B, GPU Hour=∼1.6M2025.05 | 81.59 | |
| PromptAgentBackbone=Deepseek-V32026.04 | 81.2 | |
| InfiFusionModel Size=14B, GPU Hour=1602025.05 | 80.94 | |
| Instruction InductionBase LLM=DeepSeek-V32026.03 | 80.8 | |
| Instruction InductionBase LLM=GPT-4o-mini2026.03 | 80.5 | |
| CCoTBackbone=GPT-4o-mini2026.04 | 80.5 | |
| HoTBase LLM=DeepSeek-V32026.03 | 80.4 | |
| PromptAgentBackbone=Qwen-turbo2026.04 | 80.4 | |
| Self-RefineBackbone=Deepseek-V32026.04 | 80.4 | |
| CCoTBackbone=Qwen-turbo2026.04 | 80.2 | |
| CCoTBackbone=Deepseek-V32026.04 | 80.2 | |
| HoTBase LLM=GPT-4o-mini2026.03 | 80.1 | |
| Instruction InductionBase LLM=Qwen-Turbo2026.03 | 80.1 | |
| Role / Persona PromptingBase LLM=DeepSeek-V32026.03 | 80.1 | |
| PromptAgentBackbone=GPT-4o-mini2026.04 | 80.1 | |
| HoTBase LLM=Qwen-Turbo2026.03 | 80 | |
| Self-RefineBackbone=GPT-4o-mini2026.04 | 80 | |
| Role / Persona PromptingBase LLM=GPT-4o-mini2026.03 | 79.9 | |
| Self-RefineBackbone=Qwen-turbo2026.04 | 79.8 | |
| CoTBackbone=GPT-4o2026.04 | 79.8 | |
| Prompt CanvasBase LLM=DeepSeek-V32026.03 | 79.7 | |
| Prompt CanvasBase LLM=GPT-4o-mini2026.03 | 79.6 | |
| Role / Persona PromptingBase LLM=Qwen-Turbo2026.03 | 79.5 | |
| Prompt CanvasBase LLM=Qwen-Turbo2026.03 | 79.2 | |
| DirectNormalized inference cost (T)=1.02026.04 | 78.7 | |
| CoTBackbone=Deepseek-V32026.04 | 78.5 | |
| CoTBackbone=GPT-4o-mini2026.04 | 78.3 | |
| CoTBackbone=Qwen-turbo2026.04 | 78.1 | |
| FuseLLMModel Size=14B, GPU Hour=2252025.05 | 77.62 | |
| Qwen2.5-InstructModel Size=14B, GPU Hour=∼1.8M2025.05 | 77.59 | |
| AFlowBackbone=GPT-4o2026.04 | 77.5 | |
| AFlowBackbone=Deepseek-V32026.04 | 76.4 | |
| AFlowBackbone=GPT-4o-mini2026.04 | 76 | |
| AFlowBackbone=Qwen-turbo2026.04 | 75.7 | |
| Qwen2.5-CoderModel Size=14B, GPU Hour=∼1.8M2025.05 | 75.4 | |
| APBackbone=GPT-4o2026.04 | 74.2 | |
| Analogical PromptingBase LLM=DeepSeek-V32026.03 | 72.8 | |
| APBackbone=Deepseek-V32026.04 | 72.8 | |
| Analogical PromptingBase LLM=GPT-4o-mini2026.03 | 72.5 | |
| APBackbone=GPT-4o-mini2026.04 | 72.5 | |
| Analogical PromptingBase LLM=Qwen-Turbo2026.03 | 72.2 | |
| APBackbone=Qwen-turbo2026.04 | 72.2 |