Mathematical Reasoning on AIME 24 (avg@16, pass@16)
54.8Avg@16Dr. MAS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Dr. MASBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 54.8 | 80 | |
| Dr. MASBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 46.9 | 80 | |
| Dr. MASBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 44.6 | 73.3 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 42.9 | 70 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 42.7 | 73.3 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 42.7 | 66.7 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 39.3 | 64 | |
| Dr. MASBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 39.3 | 63.3 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Single-Agent2026.02 | 38.8 | 63.3 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Single-Agent2026.02 | 36 | 67.3 | |
| TeacherModel Scale=Teacher2026.06 | 27.92 | 63.33 | |
| KAT-OPDModel Scale=Qwen3-4B-Base, Rollout Length=7362026.06 | 16.56 | 36.67 | |
| OPDModel Scale=Qwen3-4B-Base, Rollout Length=19472026.06 | 16.35 | 43.33 | |
| Fixed PrefixModel Scale=Qwen3-4B-Base, Rollout Length=9872026.06 | 15.88 | 46.67 | |
| Random TerminationModel Scale=Qwen3-4B-Base, Rollout Length=8632026.06 | 14.38 | 33.33 | |
| StudentModel Scale=Qwen3-4B-Base, Evaluation Protocol=zero-shot2026.06 | 5.21 | 40 | |
| KAT-OPDModel Scale=Qwen3-1.7B-Base, Rollout Length=4562026.06 | 4.48 | 30 | |
| Fixed PrefixModel Scale=Qwen3-1.7B-Base, Rollout Length=7302026.06 | 4.27 | 30 | |
| Random TerminationModel Scale=Qwen3-1.7B-Base, Rollout Length=6822026.06 | 3.54 | 33.33 | |
| OPDModel Scale=Qwen3-1.7B-Base, Rollout Length=10132026.06 | 3.33 | 23.33 | |
| StudentModel Scale=Qwen3-1.7B-Base, Evaluation Protocol=zero-shot2026.06 | 1.67 | 13.33 |