Expert-level Question Answering on GPQA (LLMcritic Metrics)
17.27LLMcritic CallsVecCISC + KMeans
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VecCISC + KMeansBudget=20, Backbone=Llama3.3 70B, Cluster candidate selection=min-centroid2026.05 | 17.27 | -13.63 | |
| VecCISC + KMeansBudget=20, Backbone=Qwen2.5 7B, Cluster candidate selection=min-centroid2026.05 | 16.41 | -17.93 | |
| VecCISC + KMeansBudget=20, Backbone=Llama 3.1 8B, Cluster candidate selection=min-centroid2026.05 | 13.88 | -30.57 | |
| VecCISC + KMeansBudget=20, Backbone=GPT-4o mini, Cluster candidate selection=min-centroid2026.05 | 10.56 | -47.19 | |
| VecCISC + KMeansBudget=20, Backbone=Mistral 7B, Cluster candidate selection=min-centroid2026.05 | 10.03 | -49.86 |