Puzzle Reasoning on Reasoning Gym (test)
17.8Avg@4AIPO
Evaluation Results
| Method | Links | |
|---|---|---|
| AIPOPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 17.8 | |
| AIPOPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 16 | |
| LUFFYPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 15.7 | |
| Dr.GRPOPolicy Model=Qwen2.5-7B-Instruct2026.05 | 15 | |
| OPSDPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 14.7 | |
| GRPOPolicy Model=Qwen2.5-7B-Instruct2026.05 | 14.5 | |
| LUFFYPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 13.9 | |
| AIPOPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 13.3 | |
| OPSDPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 12.4 | |
| PRIMEPolicy Model=Qwen2.5-7B-Instruct2026.05 | 12.2 | |
| LUFFYPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 11.9 | |
| AIPOPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 11 | |
| SFTPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 10.5 | |
| OPSDPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 10.4 | |
| SFTPolicy Model=Qwen2.5-7B-Instruct, Collaborator Model=Qwen2.5-7B-Instruct2026.05 | 9.8 | |
| OriginalPolicy Model=Qwen2.5-7B-Instruct2026.05 | 9.6 | |
| SFTPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Qwen3-30B-A3B-Instruct-25072026.05 | 6 | |
| LUFFYPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 4.9 | |
| OPSDPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 4.6 | |
| SFTPolicy Model=Llama3.2-3B-Instruct, Collaborator Model=Llama3.2-3B-Instruct2026.05 | 4.1 |