Distributional alignment on out-of-domain (test)
0.16Jensen-Shannon DivergenceEvi-DA
Evaluation Results
| Method | Links | |
|---|---|---|
| Evi-DABackbone=Qwen3-32B, Training Protocol=GRPO2026.03 | 0.16 | |
| Evi-DABackbone=Ministral-8B, Training Protocol=GRPO2026.03 | 0.17 | |
| Model Log-Probabilities + KLBackbone=Llama3-8B2026.03 | 0.18 | |
| Evi-DA - No trainingBackbone=Ministral-8B, Training Protocol=Zero-shot2026.03 | 0.2 | |
| Modular PluralismBackbone=Qwen3-32B2026.03 | 0.22 | |
| Evi-DA - No trainingBackbone=Qwen3-8B, Training Protocol=Zero-shot2026.03 | 0.22 | |
| Evi-DABackbone=Ministral-14B, Training Protocol=GRPO2026.03 | 0.22 | |
| Evi-DA - No trainingBackbone=Qwen3-32B, Training Protocol=Zero-shot2026.03 | 0.23 | |
| Evi-DA - No trainingBackbone=Llama3-8B, Training Protocol=Zero-shot2026.03 | 0.23 | |
| Evi-DABackbone=Average, Training Protocol=GRPO2026.03 | 0.23 | |
| Evi-DA - No trainingBackbone=Average, Training Protocol=Zero-shot2026.03 | 0.24 | |
| Evi-DA - No trainingBackbone=Ministral-14B, Training Protocol=Zero-shot2026.03 | 0.25 | |
| Evi-DABackbone=Qwen3-8B, Training Protocol=GRPO2026.03 | 0.25 | |
| Model Log-Probabilities + KLBackbone=Ministral-8B2026.03 | 0.26 | |
| SurveyPilotBackbone=Ministral-14B2026.03 | 0.27 | |
| Evi-DABackbone=Qwen3-14B, Training Protocol=GRPO2026.03 | 0.27 | |
| Modular PluralismBackbone=Llama3-8B2026.03 | 0.28 | |
| Evi-DABackbone=Llama3-8B, Training Protocol=GRPO2026.03 | 0.28 | |
| Model Log-Probabilities + KLBackbone=Qwen3-32B2026.03 | 0.29 | |
| Model Log-Probabilities + KLBackbone=Ministral-14B2026.03 | 0.29 | |
| Verbalized DistributionBackbone=Ministral-8B2026.03 | 0.29 | |
| Modular PluralismBackbone=Qwen3-14B2026.03 | 0.29 | |
| Modular PluralismBackbone=Average2026.03 | 0.29 | |
| Model Log-Probabilities + KLBackbone=Average2026.03 | 0.3 | |
| Opinion SamplingBackbone=Llama3-8B2026.03 | 0.3 | |
| SurveyPilotBackbone=Qwen3-32B2026.03 | 0.3 | |
| Evi-DA - No trainingBackbone=Qwen3-14B, Training Protocol=Zero-shot2026.03 | 0.3 | |
| Opinion SamplingBackbone=Qwen3-14B2026.03 | 0.31 | |
| Model Log-Probabilities + KLBackbone=Qwen3-14B2026.03 | 0.32 | |
| Verbalized DistributionBackbone=Ministral-14B2026.03 | 0.32 | |
| Modular PluralismBackbone=Qwen3-8B2026.03 | 0.32 | |
| Model Log-ProbabilitiesBackbone=Ministral-8B2026.03 | 0.33 | |
| SurveyPilotBackbone=Ministral-8B2026.03 | 0.33 | |
| SurveyPilotBackbone=Llama3-8B2026.03 | 0.33 | |
| SurveyPilotBackbone=Average2026.03 | 0.33 | |
| Opinion SamplingBackbone=Qwen3-32B2026.03 | 0.34 | |
| Verbalized DistributionBackbone=Qwen3-32B2026.03 | 0.34 | |
| Modular PluralismBackbone=Ministral-8B2026.03 | 0.34 | |
| Modular PluralismBackbone=Ministral-14B2026.03 | 0.34 | |
| Model Log-ProbabilitiesBackbone=Qwen3-32B2026.03 | 0.36 | |
| Opinion SamplingBackbone=Ministral-14B2026.03 | 0.36 | |
| Opinion SamplingBackbone=Average2026.03 | 0.36 | |
| Verbalized DistributionBackbone=Average2026.03 | 0.36 | |
| Model Log-ProbabilitiesBackbone=Llama3-8B2026.03 | 0.37 | |
| SurveyPilotBackbone=Qwen3-14B2026.03 | 0.37 | |
| Verbalized DistributionBackbone=Llama3-8B2026.03 | 0.38 | |
| Model Log-ProbabilitiesBackbone=Ministral-14B2026.03 | 0.39 | |
| Model Log-ProbabilitiesBackbone=Average2026.03 | 0.39 | |
| Verbalized DistributionBackbone=Qwen3-14B2026.03 | 0.39 | |
| Opinion SamplingBackbone=Ministral-8B2026.03 | 0.41 | |
| SurveyPilotBackbone=Qwen3-8B2026.03 | 0.41 | |
| Model Log-ProbabilitiesBackbone=Qwen3-14B2026.03 | 0.43 | |
| Verbalized DistributionBackbone=Qwen3-8B2026.03 | 0.43 | |
| Model Log-Probabilities + KLBackbone=Qwen3-8B2026.03 | 0.44 | |
| Opinion SamplingBackbone=Qwen3-8B2026.03 | 0.44 | |
| Model Log-ProbabilitiesBackbone=Qwen3-8B2026.03 | 0.47 |