Multiple Choice Question Answering on MMLU-Pro Health
99.2Calibration Threshold (q-hat)Conformal Social Choice
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Conformal Social ChoiceDebate Round=3, Alpha=0.05, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 99.2 | 95.6 | 4.13 | 34.2 | 72.7 | |
| Conformal Social ChoiceDebate Round=2, Alpha=0.05, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 99 | 95.8 | 3.93 | 31.6 | 84.6 | |
| Conformal Social ChoiceDebate Round=1, Alpha=0.05, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 98.4 | 96.1 | 3.53 | 28.4 | 100 | |
| Conformal Social ChoiceDebate Round=0, Alpha=0.05, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 97 | 96.3 | 3.73 | 20.3 | 91.6 | |
| Conformal Social ChoiceDebate Round=3, Alpha=0.10, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 94 | 89 | 1.38 | 72.4 | 71.4 | |
| Conformal Social ChoiceDebate Round=2, Alpha=0.10, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 93 | 89.7 | 1.42 | 68.9 | 79.4 | |
| Conformal Social ChoiceDebate Round=1, Alpha=0.10, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 92.4 | 91.4 | 1.56 | 60.6 | 88.1 | |
| Conformal Social ChoiceDebate Round=0, Alpha=0.10, Model Ensemble=Haiku + DeepSeek-R1 + Qwen-3 32B2026.04 | 90.4 | 91.4 | 1.71 | 50.4 | 92.7 |