Zero-shot Language Modeling on ARC, BoolQ, HellaSwag, OBQA, PIQA, and WinoG
27.9ARC-E AccuracyMDLM
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| MDLMevaluation_mode=zero-shot2026.02 | 27.9 | 21.16 | 47.25 | 27.76 | 19.2 | 52.01 | 50.43 | 35.1 | |
| GIDDevaluation_mode=zero-shot, noise level (p_u)=0.12026.02 | 26.85 | 22.01 | 48.99 | 26.36 | 15.6 | 50.76 | 50.27 | 34.41 | |
| SCDDevaluation_mode=zero-shot, noise level (p_u)=0.12026.02 | 26.64 | 22.01 | 48.13 | 26.73 | 17.2 | 50.05 | 48.78 | 34.22 | |
| SCDDevaluation_mode=zero-shot, noise level (p_u)=0.22026.02 | 26.52 | 24.16 | 46.64 | 26.2 | 20.4 | 49.67 | 49.01 | 34.66 | |
| GIDDevaluation_mode=zero-shot, noise level (p_u)=0.22026.02 | 26.43 | 21.92 | 48.29 | 26.55 | 15.8 | 51.09 | 50.51 | 34.37 |