Mathematical Reasoning on OmniMath (test)
55.1AccuracyAgent 1
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Agent 1Controller Backbone=Qwen3-4B-Base, Agent 1 Model=Qwen3-30B-A3B-Instruct2026.05 | 55.1 | — | — | — | — | — | — | |
| Agent 1Controller Backbone=Qwen3-8B-Base, Agent 1 Model=Qwen3-30B-A3B-Instruct2026.05 | 55.1 | — | — | — | — | — | — | |
| Iterative Critique-and-Routing ControllerController Backbone=Qwen3-8B-Base2026.05 | 53.9 | — | — | — | — | — | — | |
| Iterative Critique-and-Routing ControllerController Backbone=Qwen3-4B-Base2026.05 | 53.5 | — | — | — | — | — | — | |
| Router-R1Controller Backbone=Qwen3-4B-Base2026.05 | 50.1 | — | — | — | — | — | — | |
| Router-R1Controller Backbone=Qwen3-8B-Base2026.05 | 47.7 | — | — | — | — | — | — | |
| RouterDCController Backbone=Qwen3-8B-Base2026.05 | 46.3 | — | — | — | — | — | — | |
| RoBERTa RouterController Backbone=Qwen3-8B-Base2026.05 | 45.8 | — | — | — | — | — | — | |
| RouterDCController Backbone=Qwen3-4B-Base2026.05 | 44.5 | — | — | — | — | — | — | |
| RoBERTa RouterController Backbone=Qwen3-4B-Base2026.05 | 43.6 | — | — | — | — | — | — | |
| Controller V2Controller Backbone=Qwen3-4B-Base2026.05 | 32.8 | — | — | — | — | — | — | |
| Random RouterController Backbone=Qwen3-4B-Base2026.05 | 30.4 | — | — | — | — | — | — | |
| Controller V2Controller Backbone=Qwen3-8B-Base2026.05 | 28 | — | — | — | — | — | — | |
| Controller V1Controller Backbone=Qwen3-8B-Base2026.05 | 26.1 | — | — | — | — | — | — | |
| Controller V1Controller Backbone=Qwen3-4B-Base2026.05 | 25.5 | — | — | — | — | — | — | |
| Agent 2Controller Backbone=Qwen3-4B-Base, Agent 2 Model=Qwen2.5-7B-Instruct2026.05 | 25.4 | — | — | — | — | — | — | |
| Random RouterController Backbone=Qwen3-8B-Base2026.05 | 24.4 | — | — | — | — | — | — | |
| Agent 2Controller Backbone=Qwen3-8B-Base, Agent 2 Model=Ministral-3-8B-Instruct2026.05 | 18 | — | — | — | — | — | — | |
| Agent 3Controller Backbone=Qwen3-4B-Base, Agent 3 Model=Qwen2.5-1.5B-Instruct2026.05 | 15.7 | — | — | — | — | — | — | |
| Agent 3Controller Backbone=Qwen3-8B-Base, Agent 3 Model=Llama-3-2-1B-Instruct2026.05 | 6.7 | — | — | — | — | — | — | |
| 7B OnlyModel=Qwen2.5-Math-Instruct-7B2026.05 | — | 0.282 | — | — | — | 0 | — | |
| Base ModelBackbone=Qwen3-8B2026.01 | — | 0.314 | 0.458 | 0.489 | 0.412 | 2,600 | — | |
| Dele-GRPOBackbone=Qwen3-8B2026.01 | — | 0.431 | 0.542 | 0.571 | 0.509 | 8,400 | — | |
| Dele-SimKOBackbone=Qwen3-8B2026.01 | — | 0.446 | 0.561 | 0.592 | 0.528 | 8,500 | — | |
| GPT-4.1-miniType=Target Model Only2026.05 | — | 0.43 | — | — | — | 0.3356 | 1.28 | |
| LCoT-GRPOBackbone=Qwen3-8B2026.01 | — | 0.418 | 0.48 | 0.498 | 0.462 | 8,500 | — | |
| LCoT-SimKOBackbone=Qwen3-8B2026.01 | — | 0.435 | 0.515 | 0.54 | 0.491 | 8,600 | — | |
| policy-guided stepwise model routingExt. Models=false2026.05 | — | 0.386 | — | — | — | 0.285 | 1.35 | |
| PSamplingBackbone=Qwen3-8B2026.01 | — | 0.387 | 0.498 | 0.523 | 0.462 | 6,000 | — | |
| RSDExt. Models=true2026.05 | — | 0.402 | — | — | — | 0.2932 | 1.52 | |
| SpecReasonExt. Models=false2026.05 | — | 0.26 | — | — | — | 0.5691 | 0.46 | |
| STEERExt. Models=false2026.05 | — | 0.3 | — | — | — | 0.0823 | 3.64 | |
| TGR-LatentBackbone=Qwen3-8B2026.01 | — | 0.438 | 0.568 | 0.601 | 0.528 | 7,000 | — | |
| TGR-TokenBackbone=Qwen3-8B2026.01 | — | 0.412 | 0.53 | 0.558 | 0.493 | 7,500 | — |