General Reasoning on TheoremQA (Pass@1)
67.75Pass@1CLPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CLPOOptimization Policy=Restructuring-Aware RL, Base Model=Qwen3-8B2025.09 | 67.75 | |
| Critique-GRPO (CoT)Optimization Policy=Critique-Driven RL, Base Model=Qwen3-8B2025.09 | 59.5 | |
| Critique-GRPO (Simple)Optimization Policy=Critique-Driven RL, Base Model=Qwen3-8B2025.09 | 59 | |
| LUFFYOptimization Policy=Off-Policy Imitation, Base Model=Qwen3-8B2025.09 | 58.25 | |
| DAPOOptimization Policy=Dynamic Sampling, Base Model=Qwen3-8B2025.09 | 55 | |
| GRPOOptimization Policy=Group-Based RL, Base Model=Qwen3-8B2025.09 | 54.75 | |
| Critique-FTOptimization Policy=Learning to Critique, Base Model=Qwen3-8B2025.09 | 46 | |
| CITL-FTOptimization Policy=Mixed-Data SFT, Base Model=Qwen3-8B2025.09 | 44.25 | |
| RAFTOptimization Policy=Ranking-Based Imitation, Base Model=Qwen3-8B2025.09 | 43.5 | |
| Refinement-FTOptimization Policy=Guided Refinement, Base Model=Qwen3-8B2025.09 | 41.25 |