Political Position Ranking on Political Judgements (P_1,1) High-Confidence 1.0
0d_footruleWorst-case Baseline
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Worst-case Baselinetype=Baseline2026.02 | 0 | 0 | -1 | 0 | |
| Random Baselinetype=Baseline2026.02 | 0.333 | 0.5 | 0 | 50 | |
| Ensemble 3Aggregation=Ensemble2026.02 | 0.657 | 0.756 | 0.692 | 49.2 | |
| Ensemble 2Aggregation=Ensemble2026.02 | 0.682 | 0.782 | 0.76 | 61.7 | |
| Ensemble 1Aggregation=Ensemble2026.02 | 0.721 | 0.8 | 0.789 | 49.2 | |
| Gemini 1.5 ProModel=Gemini 1.5 Pro2026.02 | 0.743 | 0.806 | 0.778 | 58.5 | |
| DeepSeek-V3Model=DeepSeek-V32026.02 | 0.753 | 0.819 | 0.827 | 48.4 | |
| Qwen QwQModel=Qwen QwQ2026.02 | 0.76 | 0.819 | 0.813 | 67.3 | |
| DeepSeek-R1Model=DeepSeek-R12026.02 | 0.774 | 0.84 | 0.849 | 61.7 | |
| o3 MiniModel=o3 Mini2026.02 | 0.779 | 0.837 | 0.852 | 72.3 | |
| GPT 4o MiniModel=GPT 4o Mini2026.02 | 0.78 | 0.829 | 0.827 | 57 | |
| Claude 3.5 HaikuModel=Claude 3.5 Haiku2026.02 | 0.785 | 0.842 | 0.858 | 48.3 | |
| GPT 4.5Model=GPT 4.52026.02 | 0.806 | 0.852 | 0.849 | 49.2 | |
| Human (left)type=Individual Human2026.02 | 0.867 | 0.907 | 0.956 | 100 | |
| Human (right)type=Individual Human2026.02 | 0.873 | 0.914 | 0.96 | 100 | |
| Human (agg)type=Human aggregate2026.02 | 1 | 1 | 1 | 100 |