Logical Reasoning on LogiQA (Accuracy %)
78.9LogiQA AccuracyDenser
Evaluation Results
| Method | Links | |
|---|---|---|
| DenserBackbone=Qwen3-32B-think2025.12 | 78.9 | |
| Process SupervisionBackbone=Qwen3-32B-think2025.12 | 78.6 | |
| Reflection-CoTBackbone=Qwen3-32B-think2025.12 | 78.1 | |
| DenserBackbone=Qwen3-32B2025.12 | 77.3 | |
| Self-VerificationBackbone=Qwen3-32B-think2025.12 | 77.2 | |
| Tree-of-ThoughtBackbone=Qwen3-32B-think2025.12 | 76.9 | |
| Process SupervisionBackbone=Qwen3-32B2025.12 | 76.8 | |
| Reflection-CoTBackbone=Qwen3-32B2025.12 | 76.3 | |
| Self-ConsistencyBackbone=Qwen3-32B-think2025.12 | 76.3 | |
| Self-VerificationBackbone=Qwen3-32B2025.12 | 75.6 | |
| Think-to-ThinkBackbone=Qwen3-32B-think2025.12 | 75.6 | |
| Tree-of-ThoughtBackbone=Qwen3-32B2025.12 | 75.1 | |
| Self-ConsistencyBackbone=Qwen3-32B2025.12 | 74.5 | |
| Think-to-ThinkBackbone=Qwen3-32B2025.12 | 73.8 | |
| Chain-of-ThoughtBackbone=Qwen3-32B-think2025.12 | 73.5 | |
| DenserBackbone=Qwen3-8B-think2025.12 | 72.6 | |
| DenserBackbone=Qwen3-14B-no-think2025.12 | 72.5 | |
| Chain-of-ThoughtBackbone=Qwen3-32B2025.12 | 71.8 | |
| Process SupervisionBackbone=Qwen3-8B-think2025.12 | 71.7 | |
| Process SupervisionBackbone=Qwen3-14B-no-think2025.12 | 71.4 | |
| Reflection-CoTBackbone=Qwen3-8B-think2025.12 | 71.2 | |
| DenserBackbone=Qwen3-8B2025.12 | 70.9 | |
| Reflection-CoTBackbone=Qwen3-14B-no-think2025.12 | 70.9 | |
| Self-VerificationBackbone=Qwen3-8B-think2025.12 | 70.5 | |
| Self-VerificationBackbone=Qwen3-14B-no-think2025.12 | 70.3 | |
| Process SupervisionBackbone=Qwen3-8B2025.12 | 69.9 | |
| Tree-of-ThoughtBackbone=Qwen3-8B-think2025.12 | 69.9 | |
| Tree-of-ThoughtBackbone=Qwen3-14B-no-think2025.12 | 69.7 | |
| DenserBackbone=Qwen3-4B-think2025.12 | 69.4 | |
| Reflection-CoTBackbone=Qwen3-8B2025.12 | 69.4 | |
| Self-ConsistencyBackbone=Qwen3-8B-think2025.12 | 69.4 | |
| Self-ConsistencyBackbone=Qwen3-14B-no-think2025.12 | 69.2 | |
| Self-VerificationBackbone=Qwen3-8B2025.12 | 68.8 | |
| Think-to-ThinkBackbone=Qwen3-8B-think2025.12 | 68.7 | |
| Think-to-ThinkBackbone=Qwen3-14B-no-think2025.12 | 68.5 | |
| Process SupervisionBackbone=Qwen3-4B-think2025.12 | 68.3 | |
| Tree-of-ThoughtBackbone=Qwen3-8B2025.12 | 68.1 | |
| Reflection-CoTBackbone=Qwen3-4B-think2025.12 | 67.8 | |
| Self-ConsistencyBackbone=Qwen3-8B2025.12 | 67.6 | |
| Self-VerificationBackbone=Qwen3-4B-think2025.12 | 67.1 | |
| Think-to-ThinkBackbone=Qwen3-8B2025.12 | 66.9 | |
| Chain-of-ThoughtBackbone=Qwen3-8B-think2025.12 | 66.9 | |
| DenserBackbone=Qwen3-4B2025.12 | 66.8 | |
| Chain-of-ThoughtBackbone=Qwen3-14B-no-think2025.12 | 66.7 | |
| IH-GRPOBackbone=Qwen3-8B2026.05 | 66.67 | |
| Tree-of-ThoughtBackbone=Qwen3-4B-think2025.12 | 66.4 | |
| Process SupervisionBackbone=Qwen3-4B2025.12 | 66 | |
| Self-ConsistencyBackbone=Qwen3-4B-think2025.12 | 65.9 | |
| Reflection-CoTBackbone=Qwen3-4B2025.12 | 65.5 | |
| Think-to-ThinkBackbone=Qwen3-4B-think2025.12 | 65.2 | |
| Chain-of-ThoughtBackbone=Qwen3-8B2025.12 | 65.2 | |
| Self-VerificationBackbone=Qwen3-4B2025.12 | 64.9 | |
| Tree-of-ThoughtBackbone=Qwen3-4B2025.12 | 64.2 | |
| Self-ConsistencyBackbone=Qwen3-4B2025.12 | 63.8 | |
| Chain-of-ThoughtBackbone=Qwen3-4B-think2025.12 | 63.5 | |
| IH-GRPOBackbone=Qwen3-4B2026.05 | 63.29 | |
| Think-to-ThinkBackbone=Qwen3-4B2025.12 | 63.1 | |
| Chain-of-ThoughtBackbone=Qwen3-4B2025.12 | 61.7 | |
| BaseBackbone=Qwen3-4B2026.05 | 57.76 | |
| IH-GRPOBackbone=Qwen3-1.7B2026.05 | 56.99 | |
| BaseBackbone=Qwen3-8B2026.05 | 51.15 | |
| RandomIteration=2, Selection Ratio=0.2, Model Scale=3b2026.04 | 49.77 | |
| EVOSELECTIteration=1, Selection Ratio=0.5, Model Scale=3b2026.04 | 49.62 | |
| AttributionIteration=2, Selection Ratio=0.5, Model Scale=3b2026.04 | 49.16 | |
| RL+SAEModel=Qwen3-30B-A3B2026.05 | 48.75 | |
| EVOSELECTIteration=2, Selection Ratio=0.5, Model Scale=3b2026.04 | 48.54 | |
| TSDSIteration=1, Selection Ratio=0.5, Model Scale=3b2026.04 | 48.39 | |
| Vanilla RLModel=Qwen3-30B-A3B2026.05 | 48.38 | |
| Before RLModel=Qwen3-30B-A3B2026.05 | 48.12 | |
| TSDSIteration=2, Selection Ratio=0.2, Model Scale=3b2026.04 | 48.08 | |
| Before RLModel=Qwen3-8B2026.05 | 48 | |
| EVOSELECTIteration=1, Selection Ratio=0.2, Model Scale=3b2026.04 | 47.93 | |
| RandomIteration=1, Selection Ratio=0.2, Model Scale=3b2026.04 | 47.62 | |
| DiversityIteration=1, Selection Ratio=0.5, Model Scale=3b2026.04 | 47.62 | |
| DiversityIteration=1, Selection Ratio=0.2, Model Scale=3b2026.04 | 47.47 | |
| AllIteration=2, Model Scale=3b2026.04 | 47.31 | |
| Vanilla RLModel=Qwen3-8B2026.05 | 47.12 | |
| RL+SAEModel=Qwen3-8B2026.05 | 47.12 | |
| BaseIteration=Base, Model Scale=3b2026.04 | 46.7 | |
| DiversityIteration=2, Selection Ratio=0.5, Model Scale=3b2026.04 | 46.39 | |
| Attr-DivIteration=2, Selection Ratio=0.2, Model Scale=3b2026.04 | 46.24 | |
| Attr-DivIteration=2, Selection Ratio=0.5, Model Scale=3b2026.04 | 46.24 | |
| TSDSIteration=1, Selection Ratio=0.2, Model Scale=3b2026.04 | 46.08 | |
| EVOSELECTIteration=2, Selection Ratio=0.2, Model Scale=3b2026.04 | 46.08 | |
| AttributionIteration=1, Selection Ratio=0.5, Model Scale=3b2026.04 | 45.62 | |
| AttributionIteration=2, Selection Ratio=0.2, Model Scale=3b2026.04 | 45.47 | |
| TSDSIteration=2, Selection Ratio=0.5, Model Scale=3b2026.04 | 45.47 | |
| AttributionIteration=1, Selection Ratio=0.2, Model Scale=3b2026.04 | 45.31 | |
| Attr-DivIteration=1, Selection Ratio=0.5, Model Scale=3b2026.04 | 45.16 | |
| DiversityIteration=2, Selection Ratio=0.2, Model Scale=3b2026.04 | 45.16 | |
| BaseBackbone=Qwen3-1.7B2026.05 | 45.01 | |
| Attr-DivIteration=1, Selection Ratio=0.2, Model Scale=3b2026.04 | 44.85 | |
| AllIteration=1, Model Scale=3b2026.04 | 44.55 | |
| RandomIteration=2, Selection Ratio=0.5, Model Scale=3b2026.04 | 44.55 | |
| SASFTModel=Qwen3-8B-Base, Dataset=Russian 110k2025.07 | 44.5 | |
| RandomIteration=1, Selection Ratio=0.5, Model Scale=3b2026.04 | 43.78 | |
| SASFTModel=Qwen3-8B-Base, Training Set=Chinese 210k2025.07 | 43.38 | |
| SASFTBackbone=Qwen3-8B-Base, Training dataset setting=Korean 210k2025.07 | 42.88 | |
| SASFTModel=Qwen3-8B-Base2025.07 | 42.75 | |
| SASFTModel=Qwen3-8B-Base, Training Dataset=Chinese 110k2026.05 | 42.75 |