Interactive Question Answering on IQA-EVAL MMLU-derived (TextBabbage)
3.87HelpfulnessIQA-EVAL-GPT3.5
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| IQA-EVAL-GPT3.5Evaluator Backbone=GPT-3.52024.08 | 3.87 | 3.67 | 1.77 | 47 | |
| Human2024.08 | 3.84 | 3.84 | 2.57 | 52 | |
| IQA-EVAL-ClaudeEvaluator Backbone=Claude2024.08 | 3.03 | 3.47 | 2.67 | 53 | |
| IQA-EVAL-GPT4Evaluator Backbone=GPT-42024.08 | 2.3 | 3.87 | 2.27 | 83 |