Active Reasoning on ARBench
46.7DC ScoreOpenAI o3-mini (medium)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OpenAI o3-mini (medium)Size=/2026.04 | 46.7 | 43.1 | 45.1 | |
| Qwen3-Base SATSize=3×4B2026.04 | 45.3 | 41.5 | 43.9 | |
| Qwen3-Base Debate + JudgeSize=3×8B2026.04 | 44.3 | 39.4 | 43.5 | |
| GPT-4o-mini-2024-07-18Size=/2026.04 | 44 | 40.8 | 43.6 | |
| Qwen3-Base Role-playSize=3×8B2026.04 | 43.7 | 38.7 | 43.1 | |
| Qwen3-A3BSize=30B2026.04 | 43.1 | 38.4 | 42.3 | |
| Qwen3-Base DebateSize=3×8B2026.04 | 43.1 | 38 | 42.3 | |
| Qwen3 (thinking)Size=32B2026.04 | 42.7 | 38.9 | 41.1 | |
| DeepSeek-R1 Distill LlamaSize=70B2026.04 | 42.1 | 35.4 | 40.7 | |
| QwQSize=32B2026.04 | 41.9 | 36.1 | 39.5 | |
| Qwen3-BaseSize=32B2026.04 | 41.3 | 35.7 | 39.1 | |
| Qwen3-Base-DAPOSize=8B2026.04 | 40.7 | 35.9 | 39.3 | |
| Qwen3-Base-GRPOSize=8B2026.04 | 40.1 | 35.2 | 38.9 | |
| Qwen2.5-BaseSize=72B2026.04 | 39.5 | 34.1 | 38.1 | |
| Qwen3-BaseSize=14B2026.04 | 37.9 | 32.7 | 36.5 | |
| Llama 3.1-Base SATSize=3×8B2026.04 | 35.9 | 32.7 | 34.9 |