Interactive Question Answering on Natural Questions
4.9HelpfulnessLlama2
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Llama2Evaluator Model=Claude-3, Evaluation Framework=IQA-EVAL2024.08 | 4.9 | 4.84 | 3.18 | 34 | |
| ClaudeEvaluator Model=Claude-3, Evaluation Framework=IQA-EVAL2024.08 | 4.88 | 4.9 | 3.02 | 38 | |
| GPT3.5Evaluator Model=Claude-3, Evaluation Framework=IQA-EVAL2024.08 | 4.86 | 4.88 | 2.82 | 42 | |
| ZephyrEvaluator Model=Claude-3, Evaluation Framework=IQA-EVAL2024.08 | 4.84 | 4.9 | 3.02 | 28 | |
| GPT3.5Evaluator=GPT-42024.08 | 4.12 | 5 | 2.76 | 44 | |
| ClaudeEvaluator=GPT-42024.08 | 4.02 | 5 | 2.76 | 40 | |
| ZephyrEvaluator=GPT-42024.08 | 3.3 | 4.86 | 2.92 | 36 | |
| Llama2Evaluator=GPT-42024.08 | 3.2 | 4.84 | 3.08 | 32 |