General Knowledge Question Answering on MMLU (Accuracy and Token Usage)
68.5AccuracyQwen3-1.7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-1.7BSetting=ARM only2026.03 | 68.5 | 984 | |
| DeepSeek-R1Setting=ARM only2026.03 | 60 | 760 | |
| Llama-3.2-3BSetting=ARM only2026.03 | 54 | 4 | |
| LLaDA-8B → Llama-3.2-3BSetting=text-space2026.03 | 52.5 | 4 | |
| Latent-DARM (LLaDA-8B → Llama-3.2-3B)Setting=latent-space, Plan tokens=642026.03 | 52 | 2 | |
| Latent-DARM (LLaDA-8B → Llama-3.2-3B)Setting=latent-space, Plan tokens=1282026.03 | 44 | 2 | |
| Latent-DARM (LLaDA-8B → Llama-3.2-3B)Setting=latent-space, Plan tokens=2562026.03 | 15.5 | 2 |