Long-form Question Answering refinement on HQ^2A (test)
0.0065Error Rate (%)EIR
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| EIRFeedback=Fine-grained (EIR)2024.07 | 0.0065 | 0.03 | 0.97 | 1 | 0.98 | |
| ImproveFeedback=Coarse-grained (IMPROVE)2024.07 | 0.0131 | 0.05 | 1 | 0.83 | 0.97 | |
| GenericFeedback=Coarse-grained (GENERIC)2024.07 | 0.0131 | 0.05 | 0.97 | 0.97 | 0.97 | |
| Human feedbackType=Expert human feedback2024.07 | 0.0261 | 0.09 | 0.86 | 1 | 0.94 | |
| Zero-shotModel=LLaMA2-13B-chat, Prompting=Zero-shot2024.07 | 0.1569 | 0.34 | 0.56 | 0.9 | 0.69 | |
| BaselineType=Original dataset instances2024.07 | 0.1961 | 0.63 | — | — | — |