Commonsense Reasoning on CommonsenseQA (LLMcritic Metrics)
15.54LLMcritic CallsVecCISC + HAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VecCISC + HACBudget=20, Model=Mistral 7B2026.05 | 15.54 | -22.31 | |
| VecCISC + KMeansBudget=20, Backbone=Mistral 7B, Cluster candidate selection=min-centroid2026.05 | 15.54 | -22.31 | |
| VecCISC + HACBudget=20, Model=Qwen2.5 7B2026.05 | 15.23 | -23.83 | |
| VecCISC + KMeansBudget=20, Backbone=GPT-4o mini, Cluster candidate selection=min-centroid2026.05 | 13.81 | -30.95 | |
| VecCISC + HACBudget=20, Model=Llama 3.1 8B2026.05 | 12.7 | -36.5 | |
| VecCISC + KMeansBudget=20, Backbone=Llama 3.1 8B, Cluster candidate selection=min-centroid2026.05 | 12.7 | -36.5 | |
| VecCISC + KMeansBudget=20, Backbone=Qwen2.5 7B, Cluster candidate selection=min-centroid2026.05 | 12.45 | -37.76 | |
| VecCISC + HACBudget=20, Model=GPT-4o mini2026.05 | 11.89 | -40.56 | |
| VecCISC + HACBudget=20, Model=Llama3.3 70B2026.05 | 11.79 | -41.02 | |
| VecCISC + KMeansBudget=20, Backbone=Llama3.3 70B, Cluster candidate selection=min-centroid2026.05 | 11.79 | -41.02 |