Mathematical Reasoning on AIME 2022
40Accuracy (Exact Match)EVOCHAMBER
Evaluation Results
| Method | Links | |
|---|---|---|
| EVOCHAMBERBackbone=Qwen3-8B, Team size (k)=32026.05 | 40 | |
| AgentNetBackbone=Qwen3-8B, Team size (k)=32026.05 | 26.7 | |
| MemCollabBackbone=Qwen3-8B, Team size (k)=32026.05 | 23.3 | |
| SABackbone=Qwen3-8B, Team size (k)=12026.05 | 13.3 | |
| EvoMemBackbone=Qwen3-8B, Team size (k)=32026.05 | 13.3 | |
| LoRA-RLMOBackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=0, A0=V ⊤ −r2026.06 | 7.78 | |
| LoRA-RLPOBackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=0, A0=V ⊤ r2026.06 | 7.78 | |
| PiSSABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=UrΣ 1/2 r, A0=Σ1/2 r V ⊤ r2026.06 | 4.44 | |
| LoRABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=0, A0=N (0, 1/n)2026.06 | 3.33 | |
| SC (k=5)Backbone=Qwen3-8B, Team size (k)=52026.05 | 3.3 | |
| DyLANBackbone=Qwen3-8B, Team size (k)=32026.05 | 3.3 | |
| MiLoRABackbone=Qwen2.5-7B-Instruct, Fine-tuning algorithm=GRPO, Training dataset=DAPO-Math-17k, Rank=r=32, Evaluation protocol=pass@16, B0=U−rΣ 1/2 −r, A0=Σ1/2 −r V ⊤ −r2026.06 | 2.22 |