Multiple Choice Question Answering on QASC (test)
78.5AccuracyUnifiedQA 11B
Evaluation Results
| Method | Links | |
|---|---|---|
| UnifiedQA 11BModel=UnifiedQA 11B2022.10 | 78.5 | |
| TEAMBackbone=DeBERTa Large2022.10 | 74.35 | |
| ScoreBackbone=DeBERTa Large2022.10 | 71.74 | |
| UnifiedQA_T5-FTModel Size=LARGE, Protocol=Fine-Tuning2022.04 | 58.71 | |
| GenMC_T5Model Size=LARGE2022.04 | 58.06 | |
| TEAMBackbone=RoBERTa Large2022.10 | 53.8 | |
| RoBERTaModel Size=LARGE2022.04 | 50.22 | |
| ScoreBackbone=RoBERTa Large2022.10 | 46.52 | |
| F-learningsetting=mixed2025.05 | 46.44 | |
| LWF-mixedsetting=mixed2025.05 | 45.36 | |
| BSSsetting=mixed2025.05 | 44.28 | |
| UnifiedQA_T5Model Size=LARGE2022.04 | 43.74 | |
| UnifiedQA_T5*Model Size=LARGE, Reference=Khashabi et al. (2020)2022.04 | 43.3 | |
| UnifiedQA_T5-FTModel Size=BASE, Protocol=Fine-Tuning2022.04 | 43.2 | |
| vanilla-FTtraining_strategy=fine-tuning2025.05 | 42.98 | |
| GenMC_T5Model Size=BASE2022.04 | 41.72 | |
| SRSsetting=mixed2025.05 | 40.28 | |
| RoBERTaModel Size=BASE2022.04 | 34.38 | |
| ALBERTModel Size=LARGE2022.04 | 33.12 | |
| UnifiedQA_T5Model Size=BASE2022.04 | 25.7 | |
| ALBERTModel Size=BASE2022.04 | 24.55 |