Long-form Dialogue on MT-Bench+
90.5Quality ScoreFull Context
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Full ContextAgent=GPT-4.12026.01 | 90.5 | 1.63 | |
| DYCPAgent=GPT-4.12026.01 | 90.18 | 0.71 | |
| DYCPAgent=GPT-4o2026.01 | 89.02 | 0.95 | |
| DYCPAgent=Claude 4.02026.01 | 88.39 | 1.55 | |
| SeComAgent=GPT-4o2026.01 | 88.08 | 0.87 | |
| DYCPAgent=Claude 3.72026.01 | 88.05 | 2.93 | |
| Full ContextAgent=GPT-4o2026.01 | 88.03 | 1.56 | |
| SeComAgent=Claude 3.72026.01 | 87.44 | 3.08 | |
| DYCPAgent=GPT-4o mini2026.01 | 87.24 | 0.75 | |
| SeComAgent=GPT-4o mini2026.01 | 86.52 | 0.77 | |
| MemoChatAgent=Claude 3.72026.01 | 85.83 | 8.18 | |
| Full ContextAgent=Claude 4.02026.01 | 85.71 | 2.97 | |
| Full ContextAgent=GPT-4o mini2026.01 | 84.88 | 1.22 | |
| DYCPAgent=Qwen2.5-7B-Instruct (1M)2026.01 | 84.09 | 0.4 | |
| MemoChatAgent=GPT-4o2026.01 | 84.06 | 5.12 | |
| DYCPAgent=Mistral-Nemo-Instruct (128k)2026.01 | 84.01 | 0.66 | |
| Full ContextAgent=Qwen2.5-7B-Instruct (1M)2026.01 | 81.47 | 3.47 | |
| Full ContextAgent=Claude 3.72026.01 | 80.5 | 5.49 | |
| SCM4LLMsAgent=GPT-4o mini2026.01 | 80.23 | 4.97 | |
| SCM4LLMsAgent=Claude 3.72026.01 | 76.37 | 8.63 | |
| Full ContextAgent=Mistral-Nemo-Instruct (128k)2026.01 | 74.5 | 5.77 | |
| MemoChatAgent=GPT-4o mini2026.01 | 74.39 | 3.94 | |
| SCM4LLMsAgent=GPT-4o2026.01 | 72.98 | 3.39 | |
| No ContextAgent=GPT-4.12026.01 | 67.54 | 0.46 | |
| No ContextAgent=Claude 3.72026.01 | 66.87 | 2.12 | |
| No ContextAgent=Claude 4.02026.01 | 66.87 | 2.12 | |
| No ContextAgent=GPT-4o mini2026.01 | 66.13 | 0.55 | |
| No ContextAgent=GPT-4o2026.01 | 66.04 | 0.6 | |
| No ContextAgent=Qwen2.5-7B-Instruct (1M)2026.01 | 62.81 | 0.04 | |
| CondMemAgent=Qwen2.5-7B-Instruct (1M)2026.01 | 60.89 | 11.36 | |
| No ContextAgent=Mistral-Nemo-Instruct (128k)2026.01 | 60.82 | 0.06 | |
| CondMemAgent=Mistral-Nemo-Instruct (128k)2026.01 | 58.71 | 7.72 |