General Knowledge Reasoning on MMLU-CF
75.9AccuracyGHG-TDA
Evaluation Results
| Method | Links | |
|---|---|---|
| GHG-TDABase Model=Claude 3.5 Sonnet2026.02 | 75.9 | |
| AoTBase Model=Claude 3.5 Sonnet2026.02 | 75.2 | |
| GHG-TDABase Model=GPT-4o2026.02 | 75 | |
| GoTBase Model=Claude 3.5 Sonnet2026.02 | 74.4 | |
| AoTBase Model=GPT-4o2026.02 | 74.3 | |
| ToTBase Model=Claude 3.5 Sonnet2026.02 | 74.1 | |
| GoTBase Model=GPT-4o2026.02 | 73.2 | |
| TDA-RCBase LLM=DeepSeek-V32026.03 | 73.2 | |
| TDA-RCBackbone=DeepSeek-V32026.03 | 73.2 | |
| ToTBase Model=GPT-4o2026.02 | 73 | |
| CoTBase Model=Claude 3.5 Sonnet2026.02 | 73 | |
| CoTBase Model=GPT-4o2026.02 | 72.1 | |
| TDA-RCBase LLM=GPT-4o-mini2026.03 | 72.1 | |
| TDA-RCBackbone=GPT-4o-mini2026.03 | 72.1 | |
| ToTBackbone=DeepSeek-V32026.03 | 72 | |
| WORC+AC2026.04 | 71.7 | |
| ToTBackbone=GPT-4o-mini2026.03 | 71.6 | |
| TDA-RCBase LLM=Qwen-Turbo2026.03 | 71.5 | |
| TDA-RCBackbone=Qwen-Turbo2026.03 | 71.5 | |
| CoT-SCBackbone=DeepSeek-V32026.03 | 71.5 | |
| Instruction InductionBase LLM=DeepSeek-V32026.03 | 71.4 | |
| ToTBackbone=Qwen-Turbo2026.03 | 71.3 | |
| Role / Persona PromptingBase LLM=DeepSeek-V32026.03 | 71.1 | |
| CoT-SC (n=5)Backbone=GPT-4o-mini2026.03 | 71.1 | |
| CoT-SCn (sampling size)=52026.04 | 71.1 | |
| Instruction InductionBase LLM=GPT-4o-mini2026.03 | 71 | |
| AoTBackbone=GPT-4o-mini2026.03 | 70.9 | |
| AoT2026.04 | 70.9 | |
| Role / Persona PromptingBase LLM=GPT-4o-mini2026.03 | 70.8 | |
| Prompt CanvasBase LLM=DeepSeek-V32026.03 | 70.8 | |
| CoT-SC (n=5)Backbone=Qwen-Turbo2026.03 | 70.8 | |
| AoTBackbone=DeepSeek-V32026.03 | 70.8 | |
| Prompt CanvasBase LLM=GPT-4o-mini2026.03 | 70.6 | |
| Instruction InductionBase LLM=Qwen-Turbo2026.03 | 70.6 | |
| FoT (n=8)Backbone=GPT-4o-mini2026.03 | 70.6 | |
| FoTn (sampling size)=82026.04 | 70.6 | |
| AoTBackbone=Qwen-Turbo2026.03 | 70.5 | |
| FoT (n=8)Backbone=DeepSeek-V32026.03 | 70.5 | |
| Role / Persona PromptingBase LLM=Qwen-Turbo2026.03 | 70.4 | |
| HoTBase LLM=DeepSeek-V32026.03 | 70.4 | |
| FoT (n=8)Backbone=Qwen-Turbo2026.03 | 70.4 | |
| GoTBackbone=DeepSeek-V32026.03 | 70.3 | |
| AgentChain2026.04 | 70.3 | |
| Prompt CanvasBase LLM=Qwen-Turbo2026.03 | 70.2 | |
| GoTBackbone=GPT-4o-mini2026.03 | 70.2 | |
| GoTBackbone=Qwen-Turbo2026.03 | 70.1 | |
| Self-RefineBackbone=DeepSeek-V32026.03 | 70.1 | |
| HoTBase LLM=GPT-4o-mini2026.03 | 70 | |
| HoTBase LLM=Qwen-Turbo2026.03 | 69.9 | |
| CoTBackbone=DeepSeek-V32026.03 | 69.9 | |
| AFlowBackbone=DeepSeek-V32026.03 | 69.8 | |
| Self-RefineBackbone=GPT-4o-mini2026.03 | 69.7 | |
| Self-Refine2026.04 | 69.7 | |
| CoTBackbone=GPT-4o-mini2026.03 | 69.6 | |
| CoT2026.04 | 69.6 | |
| AFlowBackbone=GPT-4o-mini2026.03 | 69.5 | |
| Self-RefineBackbone=Qwen-Turbo2026.03 | 69.5 | |
| AFlow2026.04 | 69.5 | |
| CoTBackbone=Qwen-Turbo2026.03 | 69.4 | |
| AFlowBackbone=Qwen-Turbo2026.03 | 69.3 | |
| Analogical PromptingBase LLM=DeepSeek-V32026.03 | 66.1 | |
| Analogical PromptingBase LLM=GPT-4o-mini2026.03 | 65.8 | |
| Analogical Prompting2026.04 | 65.8 | |
| Analogical PromptingBase LLM=Qwen-Turbo2026.03 | 65.2 |