Multiple-Choice Question Answering on Average (OBQA, ARC-C, ARC-E, SCIQ, SIQA)
87.1Average AccuracyNTF
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| NTFTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 87.1 | 101.3 | |
| Ground TruthStudent=Qwen3-14B2026.05 | 87 | — | |
| ICL + I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 86.5 | 93.4 | |
| Reward ModelTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 86.1 | 88.2 | |
| NaiveTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 86 | 86.8 | |
| I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 85.7 | 82.9 | |
| Ground TruthStudent=Qwen3-8B2026.05 | 85.2 | — | |
| EnsembleTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 85.1 | 75 | |
| NTFTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 84.9 | 96.2 | |
| ICL + I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 84.8 | 94.9 | |
| NaiveTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 83.8 | 82.3 | |
| I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 83.8 | 82.3 | |
| EnsembleTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 82.9 | 70.9 | |
| Reward ModelTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 82.6 | 67.1 | |
| Ground TruthStudent=OLMo2-13B2026.05 | 81.2 | — | |
| NTFTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 80.9 | 95.9 | |
| Ground TruthStudent=Qwen3-4B2026.05 | 80.6 | — | |
| NTFTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 80 | 93 | |
| No-SFTTeacher=Qwen3-0.6B, Student=Qwen3-14B2026.05 | 79.4 | — | |
| ICL + I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 79.4 | 86 | |
| I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 78.8 | 79.1 | |
| NaiveTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 78.5 | 75.6 | |
| Reward ModelTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 78.4 | 62.2 | |
| ICL + I-ConfidenceTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 77.9 | 55.4 | |
| No-SFTTeacher=Qwen3-0.6B, Student=Qwen3-8B2026.05 | 77.3 | — | |
| EnsembleTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 77.2 | 60.5 | |
| Reward ModelTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 77 | 58.1 | |
| EnsembleTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 76.7 | 39.2 | |
| I-ConfidenceTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 75.1 | 17.6 | |
| NTFTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 75 | 103.5 | |
| Ground TruthStudent=Qwen3-1.7B2026.05 | 74.8 | — | |
| NaiveTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 74.7 | 12.2 | |
| ICL + I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 74.4 | 93 | |
| I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 74.3 | 91.2 | |
| EnsembleTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 74.1 | 87.7 | |
| NaiveTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 74 | 86 | |
| No-SFTTeacher=OLMo2-1B, Student=OLMo2-13B2026.05 | 73.8 | — | |
| Ground TruthStudent=OLMo2-7B2026.05 | 73.8 | — | |
| NTFTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 73.7 | 98.9 | |
| No-SFTTeacher=Qwen3-0.6B, Student=Qwen3-4B2026.05 | 72 | — | |
| ICL + I-ConfidenceTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 72 | 79.3 | |
| Reward ModelTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 71.7 | 45.6 | |
| EnsembleTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 70.9 | 66.7 | |
| NaiveTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 69.3 | 48.3 | |
| I-ConfidenceTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 69.2 | 47.1 | |
| No-SFTTeacher=Qwen3-0.6B, Student=Qwen3-1.7B2026.05 | 69.1 | — | |
| Reward ModelTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 68.8 | 42.5 | |
| No-SFTTeacher=OLMo2-1B, Student=OLMo2-7B2026.05 | 65.1 | — | |
| Ground TruthStudent=Qwen3-0.6B2026.05 | 61.9 | — | |
| ICL + I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 61.8 | 98.9 | |
| NTFTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 61.6 | 96.8 | |
| EnsembleTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 59.7 | 76.3 | |
| I-ConfidenceTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 59.4 | 73.1 | |
| NaiveTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 59.2 | 71 | |
| Reward ModelTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 59 | 68.8 | |
| Teacher PerformanceTeacher=Qwen3-0.6B2026.05 | 52.6 | — | |
| No-SFTTeacher=Qwen3-0.6B, Student=Qwen3-0.6B2026.05 | 52.6 | — | |
| NTFTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 50.5 | 113.9 | |
| ICL + I-ConfidenceTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 50 | 106.2 | |
| Ground TruthStudent=OLMo2-1B2026.05 | 49.6 | — | |
| I-ConfidenceTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 49.2 | 93.8 | |
| EnsembleTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 49.2 | 93.8 | |
| NaiveTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 49 | 90.8 | |
| Reward ModelTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 46.1 | 46.2 | |
| Teacher PerformanceTeacher=OLMo2-1B2026.05 | 43.1 | — | |
| No-SFTTeacher=OLMo2-1B, Student=OLMo2-1B2026.05 | 43.1 | — |