Arithmetic Reasoning on GSM8K (ACC, PPL)
83.3ACCGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOFramework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 83.3 | — | |
| RLOOFramework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 81.6 | — | |
| Reinforce++Framework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 78.9 | — | |
| PPOFramework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 78.1 | — | |
| ReActFramework=Agent-R1, Backbone=Qwen3-4B, Type=Training-free baseline2025.11 | 53.1 | — | |
| FP16 baselineBackbone Model=LLaMA-7B2023.08 | 30.25 | 1.47 | |
| TSLDBackbone Model=LLaMA-7B2023.08 | 26.23 | 1.52 | |
| Logit KDBackbone Model=LLaMA-7B2023.08 | 25.47 | 1.52 | |
| TSLDBackbone Model=OPT-6.7B2023.08 | 24.49 | 2.14 | |
| FP16 baselineBackbone Model=OPT-6.7B2023.08 | 22.52 | 1.89 | |
| Logit KDBackbone Model=OPT-6.7B2023.08 | 21.08 | 1.93 | |
| OPT-2.7B FP16Model=OPT-2.7B, Precision=FP162023.08 | 20.39 | 2.07 | |
| TSLDModel=OPT-2.7B, Quantization=QAT-KD (tensor-wise)2023.08 | 20.24 | 2.03 | |
| LogitModel=OPT-2.7B, Quantization=QAT-KD (tensor-wise)2023.08 | 20.02 | 2.03 | |
| GT+LogitModel=OPT-2.7B, Quantization=QAT-KD (tensor-wise)2023.08 | 19.56 | 2.12 |