Commonsense Question Answering on CommonsenseQA (CSQA2) 2.0 (dev)
58.72AccuracyELABOR
Evaluation Results
| Method | Links | |
|---|---|---|
| ELABORAnswer predictor=T5-large, Elaboration model=GPT2-large2022.09 | 58.72 | |
| GPT-3Answer predictor=T5-large2022.09 | 58.56 | |
| scratchAnswer predictor=T5-large, Elaboration model=GPT2-large2022.09 | 56.99 | |
| pipelineAnswer predictor=T5-large, Elaboration model=GPT2-large2022.09 | 56.63 | |
| selftalkAnswer predictor=T5-large2022.09 | 55.88 | |
| vanillaAnswer predictor=T5-large2022.09 | 55.25 | |
| WikipediaAnswer predictor=T5-large2022.09 | 52.14 | |
| COMETAnswer predictor=T5-large2022.09 | 52.11 |