Mathematical Reasoning on OlympiadBench (Pass@16, Avg@16)
73.6Pass@16Dr. MAS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Dr. MASBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 73.6 | 60.9 | |
| SENTModel=Qwen3-14B2025.12 | 73.33 | 61.46 | |
| Dr. MASBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 72.4 | 59.3 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 71.4 | 58.2 | |
| GRPOModel=Qwen3-14B2025.12 | 70.37 | 58.39 | |
| Dr. MASBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 70.2 | 59 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 68.9 | 56.3 | |
| Dr. MASBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 68.6 | 58.2 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Multi-Agent & LLM Non-Sharing2026.02 | 67.6 | 58.2 | |
| GRPOBackbone=Qwen3-8B, Agent Setting=Single-Agent2026.02 | 67.5 | 57.9 | |
| SENTbase_model=Qwen2.5-Math-7B2025.12 | 67.11 | 38 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Single-Agent2026.02 | 66.5 | 53.3 | |
| GRPOBackbone=Qwen3-4B, Agent Setting=Multi-Agent & LLM Sharing2026.02 | 65.6 | 57.6 | |
| GRPO w/ Enbase_model=Qwen2.5-Math-7B2025.12 | 61.17 | 37.33 | |
| GRPObase_model=Qwen2.5-Math-7B2025.12 | 61.04 | 37.56 | |
| GRPO w/ Maskbase_model=Qwen2.5-Math-7B2025.12 | 60.89 | 37.61 |