General Language Modeling Evaluation on Aggregate Wino Hella ARC-E ARC-C MMLU
56.67Average AccuracyTeacher (GPT-OSS-20B)
Evaluation Results
| Method | Links | |
|---|---|---|
| Teacher (GPT-OSS-20B)Evaluation Mode=completion mode2026.05 | 56.67 | |
| DO-ACPScoring=DO-ACP, K=42026.05 | 33.71 | |
| ACPScoring=ACP, K=42026.05 | 33.36 | |
| CPScoring=CP, K=42026.05 | 32.86 | |
| ACPScoring=ACP, K=82026.05 | 32.82 | |
| SFScoring=SF, K=42026.05 | 32.15 | |
| DO-ACPScoring=DO-ACP, K=82026.05 | 32.11 | |
| SFScoring=SF, K=82026.05 | 31.72 | |
| CPScoring=CP, K=82026.05 | 31.49 | |
| Random FFN + teacher attn2026.05 | 30.46 | |
| Random initialization2026.05 | 30.02 |