Expert-level Science Reasoning on GPQA
18.81LLMcritic CallsVecCISC + HAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VecCISC + HACBudget=20, Model=Mistral 7B2026.05 | 18.81 | -5.94 | |
| VecCISC + HACBudget=20, Model=Llama3.3 70B2026.05 | 17.95 | -10.24 | |
| VecCISC + HACBudget=20, Model=Qwen2.5 7B2026.05 | 16.41 | -17.93 | |
| VecCISC + HACBudget=20, Model=Llama 3.1 8B2026.05 | 16 | -20.02 | |
| VecCISC + HACBudget=20, Model=GPT-4o mini2026.05 | 10.56 | -47.19 |