Logical Reasoning on AutoLogi
94.1Accuracy (Avg@8)CERL full
Evaluation Results
| Method | Links | |
|---|---|---|
| CERL fullTraining=SFT+RL2026.05 | 94.1 | |
| CERL fullTraining=SFT+RL2026.05 | 93.6 | |
| CERL fullTraining=SFT+RL2026.05 | 93.6 | |
| HaloTraining=SFT+RL2026.05 | 93.5 | |
| Correctness-only RLTraining=RL2026.05 | 93.1 | |
| HaloTraining=SFT+RL2026.05 | 93 | |
| Fixed-ratio erasure + free answerTraining=None2026.05 | 92.1 | |
| HaloTraining=SFT+RL2026.05 | 91.6 | |
| Fixed-ratio erasure + free answerTraining=None2026.05 | 91 | |
| Long-answer SFTTraining=SFT2026.05 | 90.8 | |
| Fixed-ratio erasure + free answerTraining=None2026.05 | 90 | |
| Base Qwen3-14BTraining=N/A2026.05 | 89.1 | |
| Base Qwen3-8BTraining=N/A2026.05 | 89 | |
| Length-penalty RLTraining=RL2026.05 | 88.3 | |
| Length-penalty RLTraining=RL2026.05 | 88.1 | |
| Base Qwen3-32BTraining=N/A2026.05 | 87.4 | |
| Length-penalty RLTraining=RL2026.05 | 87.2 | |
| TokenSkip†Training=SFT2026.05 | 82.5 | |
| TokenSkipTraining=SFT2026.05 | 82.1 | |
| TokenSkip†Training=SFT2026.05 | 81 | |
| Teacher Policy2026.06 | 76.3 | |
| DOPDType=Dual2026.06 | 71 | |
| ExOPDType=Standard2026.06 | 68 | |
| Uni-OPDType=Standard2026.06 | 67.2 | |
| EOPDType=Adaptive2026.06 | 67.1 | |
| TIPType=Adaptive2026.06 | 65.5 | |
| OPCDType=Standard2026.06 | 65.2 | |
| Vanilla OPDType=Standard2026.06 | 64.3 | |
| OPSDType=Self2026.06 | 63.1 | |
| SDPOType=Self2026.06 | 62.9 | |
| SDFTType=Self2026.06 | 62.6 | |
| Student Policy2026.06 | 59.8 |