Mathematical Reasoning on LiveMathBench v202505 (test)
17.5Avg@4AIPO
Evaluation Results
| Method | Links | |
|---|---|---|
| AIPOPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 17.5 | |
| LUFFYPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 15.1 | |
| AIPOPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 14.9 | |
| OPSDPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 14.2 | |
| Dr.GRPOPolicy Model=Qwen2.5-7B-Instruct2026.05 | 14 | |
| GRPOPolicy Model=Qwen2.5-7B-Instruct2026.05 | 13.9 | |
| AIPOPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 13.3 | |
| LUFFYPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 13.2 | |
| OPSDPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 12.8 | |
| SFTPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 12.5 | |
| PRIMEPolicy Model=Qwen2.5-7B-Instruct2026.05 | 11.5 | |
| SFTPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 11.1 | |
| OriginalPolicy Model=Qwen2.5-7B-Instruct2026.05 | 10.8 | |
| AIPOPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 10.8 | |
| LUFFYPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 10.8 | |
| OPSDPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 9.5 | |
| OPSDPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 7 | |
| SFTPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 7 | |
| SFTPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 5.1 | |
| LUFFYPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 4.8 |