Massive Multitask Language Understanding on MMLU-Pro (LLMcritic Evaluation)
17.47LLMcritic CallsVecCISC + KMeans
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VecCISC + KMeansBudget=20, Backbone=Mistral 7B, Cluster candidate selection=min-centroid2026.05 | 17.47 | -12.66 | |
| VecCISC + KMeansBudget=20, Backbone=Llama 3.1 8B, Cluster candidate selection=min-centroid2026.05 | 14.81 | -25.94 | |
| VecCISC + KMeansBudget=20, Backbone=Llama3.3 70B, Cluster candidate selection=min-centroid2026.05 | 13.18 | -34.1 | |
| VecCISC + KMeansBudget=20, Backbone=Qwen2.5 7B, Cluster candidate selection=min-centroid2026.05 | 12.81 | -35.93 | |
| VecCISC + KMeansBudget=20, Backbone=GPT-4o mini, Cluster candidate selection=min-centroid2026.05 | 12.28 | -38.61 |