Mathematical Reasoning on MATH 500 Hard
80.8AccuracyReAct
Evaluation Results
| Method | Links | |
|---|---|---|
| ReActParadigm=Prompting, Base Model=GPT52025.12 | 80.8 | |
| PPOParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 73.4 | |
| NLACParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 72.7 | |
| GRPOParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 71.8 | |
| NLRLParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 71.5 | |
| NLQLParadigm=Fine-tuning, Base Model=QwQ-32B, Notes=ablation2025.12 | 71.2 | |
| Self-DistillationParadigm=Fine-tuning, Base Model=QwQ-32B, Notes=ablation2025.12 | 70.1 | |
| RFTParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 69.4 | |
| Self-DistillationParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct, Notes=ablation2025.12 | 57.1 | |
| NLQLParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct, Notes=ablation2025.12 | 56.4 | |
| NLACParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 56.2 | |
| NLRLParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 53.4 | |
| GRPOParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 52.5 | |
| PPOParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 52.3 | |
| RFTParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 49.8 |