Mathematical Reasoning on MATH 500 (avg@16, pass@16)
92.4Avg@16 ScoreDr. MAS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Dr. MASBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 92.4 | 97 | |
| Dr. MASBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 91.3 | 96 | |
| Dr. MASBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 90.7 | 96.2 | |
| Dr. MASBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 90.5 | 96 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 90.5 | 96.6 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Single-Agent2026.02 | 89.9 | 94.8 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 89.6 | 95 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 89.6 | 96.2 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 89.5 | 96.2 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Single-Agent2026.02 | 89 | 94.2 | |
| Scaf-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 85.7 | — | |
| Vanilla GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 83.8 | — | |
| Scaf-GRPOBackbone=Qwen2.5-Math-7B2025.10 | 79.1 | — | |
| Oat-ZeroBackbone=Qwen2.5-Math-7B2025.10 | 78.2 | — | |
| Scaf-GRPOBackbone=Qwen2.5-7B2025.10 | 77.6 | — | |
| Vanilla GRPOBackbone=Qwen2.5-7B2025.10 | 76.8 | — | |
| SimpleRL-ZeroBackbone=Qwen2.5-Math-7B2025.10 | 76.2 | — | |
| Scaf-GRPOBackbone=Qwen2.5-Math-1.5B2025.10 | 74.8 | — | |
| LUFFYBackbone=Qwen2.5-Math-7B2025.10 | 74.3 | — | |
| Vanilla GRPOBackbone=Qwen2.5-Math-7B2025.10 | 74.2 | — | |
| Vanilla GRPOBackbone=Qwen2.5-Math-1.5B2025.10 | 72.4 | — | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2025.10 | 54.7 | — | |
| Vanilla GRPOBackbone=Llama-3.2-3B-Instruct2025.10 | 50.5 | — |