Reasoning on Combined 107 Tasks (train)
68.8AccuracyR1-CI
Evaluation Results
| Method | Links | |
|---|---|---|
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI2025.05 | 68.8 | |
| GPT-4oModel=GPT-4o, Evaluation Strategy=Code Interpreter2025.05 | 67.4 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI wo IP2025.05 | 65.1 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI2025.05 | 64.7 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI wo CL2025.05 | 63.9 | |
| Qwen3-14BModel=Qwen3-14B, Evaluation Strategy=CodeSteer2025.05 | 62.5 | |
| Qwen3-14BModel=Qwen3-14B, Evaluation Strategy=All Text2025.05 | 62 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI wo IP2025.05 | 61.8 | |
| R1-CIModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=R1-CI wo GRPO2025.05 | 60.6 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI wo CL2025.05 | 60.4 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI2025.05 | 59.7 | |
| R1-CIModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=R1-CI wo GRPO2025.05 | 57.6 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI wo IP2025.05 | 56.1 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI wo CL2025.05 | 54.5 | |
| GPT-4oModel=GPT-4o, Evaluation Strategy=All Text2025.05 | 52.5 | |
| R1-CIModel=Qwen2.5-3B-Instruct, Evaluation Strategy=R1-CI wo GRPO2025.05 | 50.9 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=All Code2025.05 | 47.3 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=CodeSteer2025.05 | 44.6 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=All Text2025.05 | 40.8 | |
| Qwen2.5-14B-Instruct-1MModel=Qwen2.5-14B-Instruct-1M, Evaluation Strategy=Code Agent (CI wo Fine-tune)2025.05 | 35.9 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=CodeSteer2025.05 | 35 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=All Code2025.05 | 34.5 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=All Text2025.05 | 31.7 | |
| Qwen2.5-7B-Instruct-1MModel=Qwen2.5-7B-Instruct-1M, Evaluation Strategy=Code Agent (CI wo Fine-tune)2025.05 | 31 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=CodeSteer2025.05 | 21.6 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=All Text2025.05 | 19.6 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=All Code2025.05 | 18.6 | |
| Qwen2.5-3B-InstructModel=Qwen2.5-3B-Instruct, Evaluation Strategy=Code Agent (CI wo Fine-tune)2025.05 | 17.1 |