Next-Utterance Generation on ORCHID
86.6Subjective QualityR-Debater
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| R-DebaterBase Model=DeepSeek-V3, Setting=zero-shot2025.12 | 86.6 | 99.7 | 59.4 | 81.9 | |
| R-DebaterBase Model=GPT-4o, Setting=zero-shot2025.12 | 84.2 | 99.7 | 62.7 | 82.2 | |
| Agent4DebateBase Model=DeepSeek-V3, Setting=zero-shot2025.12 | 83.7 | 89.3 | 59 | 77.3 | |
| Agent4DebateBase Model=GPT-4o, Setting=zero-shot2025.12 | 82.1 | 91.3 | 63.1 | 78.3 | |
| R-DebaterBase Model=Claude-3.7-sonnet, Setting=zero-shot2025.12 | 78.9 | 98.5 | 70.1 | 83 | |
| LLMBase Model=DeepSeek-V3, Setting=zero-shot2025.12 | 78.3 | 87.7 | 15.8 | 59.1 | |
| LLMBase Model=Claude-3.7-sonnet, Setting=zero-shot2025.12 | 78 | 97.1 | 19 | 64.7 | |
| Naive RAGBase Model=Claude-3.7-sonnet, Setting=zero-shot2025.12 | 77.2 | 96 | 56.7 | 76.6 | |
| Agent4DebateBase Model=Claude-3.7-sonnet, Setting=zero-shot2025.12 | 76.5 | 91.7 | 61.8 | 76.7 | |
| Naive RAGBase Model=GPT-4o, Setting=zero-shot2025.12 | 76.1 | 93.9 | 60.9 | 77 | |
| LLMBase Model=GPT-4o, Setting=zero-shot2025.12 | 75.7 | 94 | 22.6 | 64.1 | |
| Naive RAGBase Model=DeepSeek-V3, Setting=zero-shot2025.12 | 73.2 | 92.7 | 58.2 | 74.7 |