Debating on Human Evaluation Debate
86.6EAGPT-4o-mini
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GPT-4o-miniModel Type=Proprietary2025.06 | 86.6 | 82.6 | 89.9 | 83.6 | 85.7 | 83 | 75.5 | 79.3 | 83.5 | |
| Inspire-DeepSeek-R8BBackbone=DeepSeek-R8B, Framework=InspireDebate2025.06 | 85.2 | 90.1 | 81.8 | 85.8 | 85.7 | 81.3 | 71.6 | 76.5 | 82.6 | |
| Inspire-Phi-3.6BBackbone=Phi-3.6B, Framework=InspireDebate2025.06 | 84.2 | 84.6 | 84.6 | 82.5 | 84 | 69.6 | 51.2 | 60.4 | 76.1 | |
| Inspire-Qwen-1.5BBackbone=Qwen-1.5B, Framework=InspireDebate2025.06 | 81.4 | 74.2 | 69.5 | 77 | 75.5 | 78.2 | 61.1 | 69.7 | 73.6 | |
| o1-miniModel Type=Proprietary2025.06 | 80.5 | 88.3 | 74.7 | 81.5 | 81.3 | 72.4 | 65.8 | 69.1 | 77.2 | |
| Inspire-LLaMA-8BBackbone=LLaMA-8B, Framework=InspireDebate2025.06 | 68.3 | 86 | 69.3 | 85.9 | 77.4 | 73 | 59.4 | 66.2 | 73.7 | |
| DeepSeek-R8BBackbone=DeepSeek-R8B, Framework=Baseline2025.06 | 51.1 | 48.7 | 60.3 | 52.1 | 53.1 | 79.7 | 58.5 | 69.1 | 58.4 | |
| Qwen-1.5BBackbone=Qwen-1.5B, Framework=Baseline2025.06 | 48.9 | 46.6 | 25.4 | 31 | 38 | 61.7 | 44.9 | 53.3 | 43.1 | |
| Phi-3.6BBackbone=Phi-3.6B, Framework=Baseline2025.06 | 48.3 | 56.7 | 54.5 | 57 | 54.1 | 64.4 | 49.4 | 56.9 | 55.1 | |
| LLaMA-8BBackbone=LLaMA-8B, Framework=Baseline2025.06 | 32.3 | 27.5 | 43.2 | 47.2 | 37.6 | 44.6 | 35 | 39.8 | 38.3 |