Planning on AutoLogic
89.1AccuracyQwen3-Base (DICE-PC)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-Base (DICE-PC)Size=3×4B2026.06 | 89.1 | |
| OpenAI o3Size=–2026.06 | 89 | |
| Qwen3-235B-A22BSize=235B2026.06 | 88.9 | |
| Qwen3-Base (DICE-FT)Size=3×4B2026.06 | 88.3 | |
| Qwen3-A3BSize=30B2026.06 | 88.1 | |
| Qwen3 (thinking)Size=32B2026.06 | 87.3 | |
| Qwen3-Inst (SC@64)Size=14B2026.06 | 87.1 | |
| QwQSize=32B2026.06 | 86.3 | |
| OpenAI o3-miniSize=–2026.06 | 86.3 | |
| Qwen3-Base Debate+Judge (FT)Size=3×8B2026.06 | 85.9 | |
| Qwen3-Inst Debate+Judge (prompt)Size=3×4B2026.06 | 85.5 | |
| Qwen3-Base Role-play (FT)Size=3×8B2026.06 | 85.5 | |
| Qwen3-Base Debate+Judge (FT)Size=3×4B2026.06 | 85.3 | |
| Qwen3-Base Debate (FT)Size=3×8B2026.06 | 85.1 | |
| Qwen3-Base Role-play (FT)Size=3×4B2026.06 | 85 | |
| Qwen3-Inst Role-play (prompt)Size=3×4B2026.06 | 84.8 | |
| Qwen3-Base Debate (FT)Size=3×4B2026.06 | 84.6 | |
| Qwen3-Inst Debate (prompt)Size=3×4B2026.06 | 84.2 | |
| Llama 3.1-Base (DICE-PC)Size=3×8B2026.06 | 83.9 | |
| DeepSeek-R1 DistillSize=70B2026.06 | 83.5 | |
| Qwen3-Inst (Few-shot CoT)Size=4B2026.06 | 83 | |
| Qwen3-Base-DAPOSize=14B2026.06 | 82.1 | |
| Qwen3-Base-GRPOSize=14B2026.06 | 81.4 | |
| Qwen3-Base-DAPOSize=8B2026.06 | 80.9 | |
| Qwen3-Inst (ReAct)Size=4B2026.06 | 80.6 | |
| Qwen3-Base-GRPOSize=8B2026.06 | 80.3 | |
| Qwen3-Base-PPOSize=8B2026.06 | 79.9 | |
| Qwen3-BaseSize=14B2026.06 | 79.1 | |
| Qwen3-BaseSize=32B2026.06 | 78.5 | |
| Qwen3-Inst (SC@64)Size=4B2026.06 | 78.1 | |
| Qwen3-Inst (ToT)Size=4B2026.06 | 77.8 | |
| Qwen2.5-BaseSize=72B2026.06 | 76.7 | |
| Qwen3-Inst (Zero-shot CoT)Size=4B2026.06 | 63.5 | |
| GPT-4o-miniSize=–2026.06 | 62.5 |