Reasoning on GPQA-D
59.47AccuracyT3S
Evaluation Results
| Method | Links | |
|---|---|---|
| T3SDataset=BOBA-200, Teacher Model=DeepSeek-R1, Student Model=Qwen3-8B2026.01 | 59.47 | |
| T3SDataset=S1K-200, Teacher Model=DeepSeek-R1, Student Model=Qwen3-8B2026.01 | 58.59 | |
| T3SDataset=S1K-200, Teacher Model=QWQ, Student Model=Qwen3-8B2026.01 | 58.59 | |
| SFTDataset=BOBA-200, Teacher Model=QWQ, Student Model=Qwen3-8B2026.01 | 58.33 | |
| SFTDataset=S1K-200, Teacher Model=DeepSeek-R1, Student Model=Qwen3-8B2026.01 | 58.33 | |
| T3SDataset=BOBA-200, Teacher Model=QWQ, Student Model=Qwen3-8B2026.01 | 58.21 | |
| BaseStudent Model=Qwen3-8B2026.01 | 57.77 | |
| SFTDataset=S1K-200, Teacher Model=QWQ, Student Model=Qwen3-8B2026.01 | 57.32 | |
| SFTDataset=BOBA-200, Teacher Model=DeepSeek-R1, Student Model=Qwen3-8B2026.01 | 56.34 | |
| SPIRALFamily=DeepSeek-Distill-Qwen-7B Family, Game=Multi-Game2025.06 | 49.6 | |
| DeepSeek-Distill-Qwen-7BFamily=DeepSeek-Distill-Qwen-7B Family2025.06 | 48.6 | |
| R-Few (5%)Backbone=Qwen3-8B-Base, Methodology=R-Few, Supervision Ratio=5%2025.12 | 46.5 | |
| General-ReasonerBackbone=Qwen3-4B-Base, Methodology=General-Reasoner, Supervision Ratio=232k WebInstruct2025.12 | 42.9 | |
| General-ReasonerBackbone=Qwen3-8B-Base, Methodology=General-Reasoner, Supervision Ratio=232k WebInstruct2025.12 | 42.9 | |
| R-ZeroBackbone=Qwen3-8B-Base, Methodology=R-Zero, Supervision Ratio=None2025.12 | 40.5 | |
| R-Few (1%)Backbone=Qwen3-8B-Base, Methodology=R-Few, Supervision Ratio=1%2025.12 | 40.4 | |
| SPIRALFamily=Qwen3-4B-Base Family, Game=Multi-Game2025.06 | 40.1 | |
| R-Few (5%)Backbone=Qwen3-4B-Base, Methodology=R-Few, Supervision Ratio=5%2025.12 | 39.9 | |
| GCWMModel Scale=Qwen3-14B2026.05 | 39.9 | |
| SPICEBackbone=Qwen3-4B-Base, Methodology=SPICE, Supervision Ratio=None2025.12 | 39.4 | |
| SPICEBackbone=Qwen3-8B-Base, Methodology=SPICE, Supervision Ratio=None2025.12 | 39.4 | |
| GCWMModel Scale=Qwen3-8B2026.05 | 38.8 | |
| TIESModel Scale=Qwen3-8B2026.05 | 38.4 | |
| TIESModel Scale=Qwen3-14B2026.05 | 36.9 | |
| Absolute ZeroBackbone=Qwen3-8B-Base, Methodology=Absolute Zero, Supervision Ratio=None2025.12 | 36.8 | |
| R-ZeroBackbone=Qwen3-4B-Base, Methodology=R-Zero, Supervision Ratio=None2025.12 | 36.4 | |
| TAModel Scale=Qwen3-14B2026.05 | 36.4 | |
| R-Few (1%)Backbone=Qwen3-4B-Base, Methodology=R-Few, Supervision Ratio=1%2025.12 | 35.4 | |
| GCWMModel Scale=Qwen3-4B2026.05 | 35.4 | |
| Absolute ZeroBackbone=Qwen3-4B-Base, Methodology=Absolute Zero, Supervision Ratio=None2025.12 | 35.3 | |
| Base ModelBackbone=Qwen3-8B-Base, Methodology=Base, Supervision Ratio=None2025.12 | 33.3 | |
| TIESModel Scale=Qwen3-4B2026.05 | 32.8 | |
| TAModel Scale=Qwen3-4B2026.05 | 32.3 | |
| TIESModel Scale=Qwen3-1.7B2026.05 | 31.3 | |
| TAModel Scale=Qwen3-8B2026.05 | 31.3 | |
| Qwen3-4B-BaseFamily=Qwen3-4B-Base Family2025.06 | 30.6 | |
| DAREModel Scale=Qwen3-4B2026.05 | 26.8 | |
| Base ModelBackbone=Qwen3-4B-Base, Methodology=Base, Supervision Ratio=None2025.12 | 26.3 | |
| GCWMModel Scale=Qwen3-1.7B2026.05 | 26.3 | |
| TAModel Scale=Qwen3-0.6B2026.05 | 24.8 | |
| GCWMModel Scale=Qwen3-0.6B2026.05 | 23.2 | |
| TIESModel Scale=Qwen3-0.6B2026.05 | 22.7 | |
| TAModel Scale=Qwen3-1.7B2026.05 | 21.7 | |
| DAREModel Scale=Qwen3-1.7B2026.05 | 19.2 | |
| IOA (Ours)Model=Qwen2.5-7B2026.02 | 17.08 | |
| SuperCorrectModel=Qwen2.5-7B2026.02 | 15.05 | |
| POCLModel=Qwen2.5-7B2026.02 | 13.79 | |
| GKDModel=Qwen2.5-7B2026.02 | 13.73 | |
| DistiLLM-2Model=Qwen2.5-7B2026.02 | 13.47 | |
| ABKDModel=Qwen2.5-7B2026.02 | 12.99 | |
| DAREModel Scale=Qwen3-14B2026.05 | 7.1 | |
| DAREModel Scale=Qwen3-0.6B2026.05 | 5.6 | |
| DAREModel Scale=Qwen3-8B2026.05 | 2.5 |