Reasoning on Reasoning-Gym (train)
63.3AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oModel=GPT-4o, Evaluation Strategy=Code Interpreter2025.05 | 63.3 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI2025.05 | 58.9 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI wo IP2025.05 | 54.4 | |
| Qwen3-14BModel=Qwen3-14B, Evaluation Strategy=CodeSteer2025.05 | 53.8 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI2025.05 | 53.6 | |
| Qwen3-14BModel=Qwen3-14B, Evaluation Strategy=All Text2025.05 | 52.9 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI wo CL2025.05 | 52.8 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI wo IP2025.05 | 50.8 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI wo CL2025.05 | 49.1 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI wo GRPO2025.05 | 48.3 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI2025.05 | 46.6 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI wo GRPO2025.05 | 45.6 | |
| GPT-4oModel=GPT-4o, Evaluation Strategy=All Text2025.05 | 45.5 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI wo IP2025.05 | 42.5 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI wo CL2025.05 | 40.9 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=All Code2025.05 | 40.4 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=CodeSteer2025.05 | 37.8 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI wo GRPO2025.05 | 36.9 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=All Text2025.05 | 35.8 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=Code Agent (CI wo Fine-tune)2025.05 | 30 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=CodeSteer2025.05 | 26.4 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=All Text2025.05 | 25.7 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=All Code2025.05 | 25.7 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=Code Agent (CI wo Fine-tune)2025.05 | 20 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=All Text2025.05 | 11.2 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=CodeSteer2025.05 | 8.9 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=Code Agent (CI wo Fine-tune)2025.05 | 5.4 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=All Code2025.05 | 5 |