Multitask Language Understanding on MMLU (Accuracy and Performance Gain)
73.5AccuracyQwen3 8B Base
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3 8B BaseClassifier=Self-labeled2026.01 | 73.5 | -2.5 | |
| Qwen3 8B BaseClassifier=Majority-labeled2026.01 | 73.5 | -2.5 | |
| Llama 3.1 8BClassifier=Self-labeled2026.01 | 63.9 | -0.8 | |
| Llama 3.1 8BClassifier=Majority-labeled2026.01 | 63.6 | -1.1 | |
| Mistral Nemo Base 2407Classifier=Self-labeled2026.01 | 62.6 | -1.3 | |
| Mistral Nemo Base 2407Classifier=Majority-labeled2026.01 | 62.3 | -1.6 | |
| Mistral 7B v0.3Classifier=Self-labeled2026.01 | 58.7 | -1.3 | |
| Mistral 7B v0.3Classifier=Majority-labeled2026.01 | 58.5 | -1.5 | |
| Llama 3.2 1BClassifier=Self-labeled2026.01 | 43.8 | 1.5 | |
| Qwen3 0.6BClassifier=Self-labeled2026.01 | 42 | -1 | |
| Qwen3 0.6BClassifier=Majority-labeled2026.01 | 41.4 | -1.6 | |
| Llama 3.2 1BClassifier=Majority-labeled2026.01 | 41.1 | -1.1 |