Document-grounded Utterance Completion
135Model Wins CountLlama (ours)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Llama (ours)Evaluation Protocol=vs. Original, Model Variant=Post-trained2025.08 | 135 | 46 | 291 | 9 | — | |
| Gemma (ours)Evaluation Protocol=vs. Original, Model Variant=Post-trained2025.08 | 121 | 45 | 299 | 16 | — | |
| Gemma (ours)Evaluation Protocol=vs. Human, Model Variant=Post-trained2025.08 | 109 | 97 | 259 | 16 | 79.1 | |
| Llama (ours)Evaluation Protocol=vs. Human, Model Variant=Post-trained2025.08 | 90 | 114 | 257 | 20 | 75.3 | |
| Gemma (original)Evaluation Protocol=vs. Human, Model Variant=Original2025.08 | 88 | 130 | 244 | 19 | 71.9 | |
| Llama (original)Evaluation Protocol=vs. Human, Model Variant=Original2025.08 | 83 | 160 | 227 | 11 | 66 | |
| ClaudeEvaluation Protocol=vs. Human, Model Variant=Off-the-shelf2025.08 | 76 | 168 | 220 | 17 | 63.8 | |
| GPTEvaluation Protocol=vs. Human, Model Variant=Off-the-shelf2025.08 | 73 | 192 | 203 | 13 | 59 |