Multiple-Choice Question Answering on QuALITY Hard Subset
62.9AccuracyDTCRS + GPT-4o-mini
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DTCRS + GPT-4o-miniMethod=DTCRS, Language Model=GPT-4o-mini2026.04 | 62.9 | 48.2 | |
| RAPTOR + GPT-4o-miniRetriever=RAPTOR, Language Model=GPT-4o-mini2026.04 | 57 | 44.9 | |
| CoLISA + DeBERTaV3-largeRetriever=CoLISA, Reader=DeBERTaV3-large2026.04 | 54.7 | 39.6 | |
| DPR + GPT-4o-miniRetriever=DPR, Language Model=GPT-4o-mini2026.04 | 50.3 | 35.9 | |
| DPR + DeBERTaV3-largeRetriever=DPR, Reader=DeBERTaV3-large2026.04 | 46.1 | 28.1 | |
| Longformer-baseBackbone=Longformer-base2026.04 | 29.3 | 5.7 |