Logical Reasoning on SATBench
70AccuracySFT
Evaluation Results
| Method | Links | |
|---|---|---|
| SFTTraining Data=PC-83K, Base Model=Qwen2.5-7B-Instruct2025.08 | 70 | |
| RL (PC-83K)Training Data=PC-83K, Base Model=Qwen2.5-7B-Instruct, Training Method=RL (GRPO)2025.08 | 62 | |
| RL (PC-SL-35K)Training Data=PC-SL-35K, Base Model=Qwen2.5-7B-Instruct, Training Method=RL2025.08 | 58.4 | |
| RL (PC-83K+PC-SL-35K)Training Data=PC-83K + PC-SL-35K, Base Model=Qwen2.5-7B-Instruct, Training Method=RL2025.08 | 57.2 | |
| Qwen2.5-7B-InstructBase Model=Qwen2.5-7B-Instruct2025.08 | 51.6 |