Logical Reasoning on LogicNLI
63.55AccuracyOurs
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| OursBackbone=Qwen3-4B2026.05 | 63.55 | 0 | 0.0474 | 1,321.94 | — | — | — | — | |
| Stream (Ours)Model=Qwen3-4B2026.05 | 63.55 | — | 47.39 | 1,321.94 | 0 | — | — | — | |
| StreamingThinkerParadigm=Streaming, Reasoning Depth=D3, Model=Qwen3-4B2025.10 | 63.4 | 42.06 | 18.45 | — | — | — | — | — | |
| StreamingThinkerParadigm=Streaming, Reasoning Depth=D2, Model=Qwen3-4B2025.10 | 62.9 | 42.06 | 9.9 | — | — | — | — | — | |
| InterleavedParadigm=Interleaved, Reasoning Depth=D3, Model=Qwen3-4B2025.10 | 62.7 | 42.06 | 38.5 | — | — | — | — | — | |
| VanillaBackbone=Qwen3-4B2026.05 | 62 | 358.5 | 0.0583 | 2,049.53 | — | — | — | — | |
| VanillaModel=Qwen3-4B2026.05 | 62 | — | 58.31 | 2,049.53 | 358.5 | — | — | — | |
| VanillaBackbone=Qwen3-1.7B2026.05 | 61.55 | 358.5 | 0.046 | 2,049.59 | — | — | — | — | |
| VanillaModel=Qwen3-1.7B2026.05 | 61.55 | — | 45.95 | 2,049.59 | 358.5 | — | — | — | |
| InterleavedParadigm=Interleaved, Reasoning Depth=D2, Model=Qwen3-4B2025.10 | 61.4 | 42.06 | 30.47 | — | — | — | — | — | |
| OursBackbone=Qwen3-1.7B2026.05 | 61.25 | 0 | 0.0382 | 1,336.44 | — | — | — | — | |
| Stream (Ours)Model=Qwen3-1.7B2026.05 | 61.25 | — | 38.18 | 1,336.44 | 0 | — | — | — | |
| StreamingThinkerParadigm=Streaming, Reasoning Depth=D1, Model=Qwen3-4B2025.10 | 60.3 | 42.06 | 0.72 | — | — | — | — | — | |
| InterleavedParadigm=Interleaved, Reasoning Depth=D1, Model=Qwen3-4B2025.10 | 59.1 | 42.06 | 21.17 | — | — | — | — | — | |
| BaseBackbone=Qwen3-4B2026.05 | 53.7 | 336.5 | 0.1315 | 4,177.9 | — | — | — | — | |
| BaseModel=Qwen3-4B2026.05 | 53.7 | — | 131.49 | 4,177.9 | 336.5 | — | — | — | |
| BatchParadigm=Batch, Model=Qwen3-4B2025.10 | 49.2 | 350.08 | 46.92 | — | — | — | — | — | |
| HRPOBackbone=Qwen3-4B2026.06 | 48.9 | — | — | — | — | 462.599 | 129.38 | 591.985 | |
| SFT-basedBackbone=Qwen3-4B2026.06 | 47.4 | — | — | — | — | 432.131 | 132.102 | 564.248 | |
| BaseBackbone=Qwen3-1.7B2026.05 | 45.05 | 336.5 | 0.103 | 4,199.92 | — | — | — | — | |
| BaseModel=Qwen3-1.7B2026.05 | 45.05 | — | 102.95 | 4,199.92 | 336.5 | — | — | — | |
| GRPOBackbone=Qwen3-4B2026.06 | 44.5 | — | — | — | — | 473.971 | 121.277 | 595.263 | |
| CPMIReward Type=CPMI, Zero-shot BoN@8=true2026.04 | 32.1 | — | — | — | — | — | — | — | |
| CPMI_MergeReward Type=CPMI_Merge, Zero-shot BoN@8=true2026.04 | 30.8 | — | — | — | — | — | — | — | |
| MCReward Type=MC, Zero-shot BoN@8=true2026.04 | 25.4 | — | — | — | — | — | — | — | |
| Rand_MergeReward Type=Rand_Merge, Zero-shot BoN@8=true2026.04 | 24.5 | — | — | — | — | — | — | — |