Multi-answer Machine Reading Comprehension on MultiSpanQA (val)
0.7193EM F1 ScoreVanilla BART-large
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Vanilla BART-largeModel=BART-large, Setting=Supervised2023.06 | 0.7193 | — | — | — | — | 0.8583 | |
| ITERATIVEBackbone=RoBERTa2023.06 | 0.6714 | 0.6632 | 0.6798 | 0.8439 | 0.8096 | 0.8264 | |
| Vanilla BART-baseModel=BART-base, Setting=Supervised2023.06 | 0.6677 | — | — | — | — | 0.8124 | |
| TAGGINGBackbone=RoBERTa2023.06 | 0.6485 | 0.6131 | 0.6884 | 0.8045 | 0.8308 | 0.8175 | |
| GENERATIONBackbone=BART-base2023.06 | 0.6397 | 0.654 | 0.626 | 0.8206 | 0.7814 | 0.8006 | |
| GPT-3.5 + NUMPEDModel=GPT-3.5, Setting=One-Shot2023.06 | 0.6345 | — | — | — | — | 0.8238 | |
| Vanilla GPT-3.5Model=GPT-3.5, Setting=One-Shot2023.06 | 0.5334 | — | — | — | — | 0.7927 | |
| NUMPREDBackbone=RoBERTa2023.06 | 0.5015 | 0.5503 | 0.4606 | 0.8016 | 0.7526 | 0.7763 |