Question Answering on GPQA (Strict Accuracy, Acceptance Length)
63.1Strict AccuracyLaTER (training)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LaTER (training)Backbone=Qwen3-14B2026.05 | 63.1 | 3,885 | |
| CoT BaselineBackbone=Qwen3-14B2026.05 | 62.6 | 6,301 | |
| CoT-SFTBackbone=Qwen3-14B2026.05 | 61.1 | 5,885 | |
| LaTER (training-free)Backbone=Qwen3-14B2026.05 | 60.6 | 4,445 | |
| NHA-Qwen3-30BA3BModel=NHA-Qwen3-30BA3B, Architecture Type=Native Hybrid Attention, Full-attention layers=32025.10 | 41.96 | — | |
| Cactusm=10, δ=1, Verifier model=Qwen 3 32B, Drafter model=Qwen 3 1.7B2026.04 | 41.92 | 6.36 | |
| IBTPOMaximum truncation length=8K2026.05 | 41.9 | — | |
| IBTPOMaximum truncation length=4K2026.05 | 41.5 | — | |
| Qwen3-30BA3BModel=Qwen3-30BA3B, Architecture Type=Transformer2025.10 | 40.62 | — | |
| SpSm=10, Verifier model=Qwen 3 32B, Drafter model=Qwen 3 1.7B2026.04 | 40.4 | 3.73 | |
| TASm=10, Verifier model=Qwen 3 32B, Drafter model=Qwen 3 1.7B2026.04 | 40.4 | 6.12 | |
| TreeRLMaximum truncation length=4K2026.05 | 39.5 | — | |
| TreeRLMaximum truncation length=8K2026.05 | 39.3 | — | |
| Vanilla GRPOMaximum truncation length=4K2026.05 | 38.1 | — | |
| Vanilla GRPOMaximum truncation length=8K2026.05 | 37.9 | — | |
| Initial ModelMaximum truncation length=4K2026.05 | 26.3 | — | |
| Initial ModelMaximum truncation length=8K2026.05 | 26.2 | — |