Logical Reasoning on ZebraLogic
98.8AccuracyGPT-5 (High)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5 (High)2026.02 | 98.8 | — | |
| DS V3.2-Thinking2026.02 | 97.6 | — | |
| ERNIE 5.02026.02 | 96.5 | — | |
| Gemini 3-Pro2026.02 | 95.5 | — | |
| Gemini 2.5-Pro2026.02 | 92.9 | — | |
| VERGE Fullbackbone=GPT-120B2026.01 | 91 | — | |
| VERGE w/o Rtbackbone=GPT-120B2026.01 | 90.9 | — | |
| VERGE w/o MCSbackbone=GPT-120B2026.01 | 88.9 | — | |
| VERGE Fullbackbone=GPT-20B2026.01 | 87.3 | — | |
| Qwen 3 VL 32B InstructParameters=32B2025.12 | 86.7 | — | |
| General Teacher2026.05 | 84.8 | — | |
| CoTbackbone=GPT-120B2026.01 | 84 | — | |
| VERGE w/o Rtbackbone=GPT-20B2026.01 | 83.6 | — | |
| VERGE w/o MCSbackbone=GPT-20B2026.01 | 80.9 | — | |
| SCbackbone=GPT-120B2026.01 | 77.8 | — | |
| Relaxed OPD2026.05 | 73.2 | — | |
| Vanilla MOPD2026.05 | 72.6 | — | |
| CaMOPD2026.05 | 72.6 | — | |
| SCbackbone=GPT-20B2026.01 | 72.2 | — | |
| SRbackbone=GPT-120B2026.01 | 72.2 | — | |
| SelecTKD2026.05 | 72.1 | — | |
| Medical Teacher2026.05 | 71.6 | — | |
| CoTbackbone=GPT-20B2026.01 | 67.6 | — | |
| VERGE Fullbackbone=Sonnet-3.72026.01 | 64.8 | — | |
| VERGE w/o Rtbackbone=Sonnet-3.72026.01 | 62.8 | — | |
| Olmo 3.1 32B InstructStage=Final Instruct 3.12025.12 | 61.7 | — | |
| SRbackbone=Sonnet-3.72026.01 | 58.8 | — | |
| VERGE w/o MCSbackbone=Sonnet-3.72026.01 | 58 | — | |
| CoTbackbone=Sonnet-3.72026.01 | 52 | — | |
| Olmo 3.1 32B InstructStage=DPO2025.12 | 51.1 | — | |
| SCbackbone=Sonnet-3.72026.01 | 51 | — | |
| DSBbackbone=Sonnet-3.72026.01 | 48 | — | |
| SRbackbone=GPT-20B2026.01 | 46.2 | — | |
| DSBbackbone=GPT-20B2026.01 | 44.8 | — | |
| BridgeBackbone=DS-Llama-8B, Generation Width=82025.10 | 44.7 | — | |
| P-MatchBackbone=DS-Llama-8B2025.10 | 43.5 | — | |
| RLVRBackbone=DS-Llama-8B2025.10 | 43.25 | — | |
| P-MatchBackbone=DS-Qwen-7B2025.10 | 42.95 | — | |
| BridgeBackbone=DS-Qwen-7B, Generation Width=82025.10 | 42.6 | — | |
| RLVRBackbone=DS-Qwen-7B2025.10 | 41.25 | — | |
| DS-Llama-8BBackbone=DS-Llama-8B2025.10 | 41.25 | — | |
| DS-Qwen-7BBackbone=DS-Qwen-7B2025.10 | 40 | — | |
| BridgeBackbone=DS-Qwen-1.5B, Generation Width=82025.10 | 33.15 | — | |
| P-MatchBackbone=DS-Qwen-1.5B2025.10 | 32.55 | — | |
| DS-Qwen-1.5BBackbone=DS-Qwen-1.5B2025.10 | 30.9 | — | |
| RLVRBackbone=DS-Qwen-1.5B2025.10 | 30.9 | — | |
| Olmo 3.1 32B InstructStage=SFT2025.12 | 30.6 | — | |
| Qwen 3 32BThinking=No, Parameters=32B2025.12 | 28.4 | — | |
| DSBbackbone=GPT-120B2026.01 | 28.2 | — | |
| DOPDType=Dual2026.06 | 26.9 | — | |
| DRIFTBase Model=OpenR1-Distill-7B2026.06 | 25.88 | — | |
| IF (Impl. w. GraSS)Base Model=OpenR1-Distill-7B2026.06 | 25.8 | — | |
| RDSBase Model=OpenR1-Distill-7B2026.06 | 25.48 | — | |
| Teacher Policy2026.06 | 25 | — | |
| BM25Base Model=OpenR1-Distill-7B2026.06 | 24.95 | — | |
| Gemma 3 27BParameters=27B2025.12 | 24.8 | — | |
| QuratingBase Model=OpenR1-Distill-7B2026.06 | 24.73 | — | |
| LESSBase Model=OpenR1-Distill-7B2026.06 | 24.3 | — | |
| Qwen 2.5 32BParameters=32B2025.12 | 24.1 | — | |
| OpenR1-Distill-7BBase Model=OpenR1-Distill-7B2026.06 | 23.85 | — | |
| Random BaselineBase Model=OpenR1-Distill-7B2026.06 | 23.75 | — | |
| DSIRBase Model=OpenR1-Distill-7B2026.06 | 22.3 | — | |
| Uni-OPDType=Standard2026.06 | 22.3 | — | |
| Self-DistillationBase Model=OpenR1-Distill-7B2026.06 | 20.53 | — | |
| ExOPDType=Standard2026.06 | 19.9 | — | |
| EOPDType=Adaptive2026.06 | 19.3 | — | |
| DRIFTBase Model=Olmo3-7B-Instruct-SFT2026.06 | 18.9 | — | |
| TIPType=Adaptive2026.06 | 18.7 | — | |
| Self-DistillationBase Model=Olmo3-7B-Instruct-SFT2026.06 | 17.63 | — | |
| DSIRBase Model=Olmo3-7B-Instruct-SFT2026.06 | 17.45 | — | |
| Olmo3-7B-Instruct-SFTBase Model=Olmo3-7B-Instruct-SFT2026.06 | 17.23 | — | |
| Gemma 2 27BParameters=27B2025.12 | 17.2 | — | |
| QuratingBase Model=Olmo3-7B-Instruct-SFT2026.06 | 17.13 | — | |
| OPCDType=Standard2026.06 | 17 | — | |
| BM25Base Model=Olmo3-7B-Instruct-SFT2026.06 | 16.9 | — | |
| Random BaselineBase Model=Olmo3-7B-Instruct-SFT2026.06 | 16.58 | — | |
| IF (Impl. w. GraSS)Base Model=Olmo3-7B-Instruct-SFT2026.06 | 16.58 | — | |
| RDSBase Model=Olmo3-7B-Instruct-SFT2026.06 | 16.5 | — | |
| Vanilla OPDType=Standard2026.06 | 15.8 | — | |
| SDFTType=Self2026.06 | 15.4 | — | |
| LESSBase Model=Olmo3-7B-Instruct-SFT2026.06 | 15.23 | — | |
| SDPOType=Self2026.06 | 15.1 | — | |
| OPSDType=Self2026.06 | 14.7 | — | |
| OLMo 2 32BParameters=32B2025.12 | 13.3 | — | |
| Student Policy2026.06 | 12.1 | — | |
| Apertus 70BParameters=70B2025.12 | 9 | — | |
| Base Qwen3-14BTraining=N/A2026.05 | — | 88.5 | |
| Base Qwen3-8BTraining=N/A2026.05 | — | 84.8 | |
| CERL fullTraining=SFT+RL2026.05 | — | 95.3 | |
| CERL fullTraining=SFT+RL2026.05 | — | 92.4 | |
| Correctness-only RLTraining=RL2026.05 | — | 89.2 | |
| Fixed-ratio erasure + free answerTraining=None2026.05 | — | 91.4 | |
| Fixed-ratio erasure + free answerTraining=None2026.05 | — | 85.5 | |
| HaloTraining=SFT+RL2026.05 | — | 91.8 | |
| HaloTraining=SFT+RL2026.05 | — | 89.1 | |
| Length-penalty RLTraining=RL2026.05 | — | 88.7 | |
| Length-penalty RLTraining=RL2026.05 | — | 85 | |
| Long-answer SFTTraining=SFT2026.05 | — | 85.7 | |
| TokenSkipTraining=SFT2026.05 | — | 78.3 | |
| TokenSkip†Training=SFT2026.05 | — | 81 |