Cross-lingual Question Answering on MLQA v1.0 (test)
75.1F1 (es)INFOXLM
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| INFOXLMsize=large2020.07 | 75.1 | 84.5 | 71.6 | 57.3 | 71.2 | 56.2 | 67.6 | 47.6 | 72.5 | 54.2 | 75.2 | 54.1 | 69.2 | 45.4 | 73.6 | 55.2 | |
| XLM-RScale=large2021.10 | 74.7 | 83.9 | — | — | 69.9 | — | 64.9 | — | 69.9 | — | 73.3 | — | 70.3 | — | 72.4 | — | |
| mLUKE-EScale=large, Input Features=words+entities2021.10 | 74.5 | 84.1 | — | — | 70.5 | — | 66.2 | — | 71.4 | — | 74.3 | — | 70.5 | — | 73.1 | — | |
| XLM-Rsize=large, reimpl=true2020.07 | 74.4 | 84 | 71.1 | 56.4 | 70.2 | 55 | 66.5 | 46.3 | 71.1 | 53.2 | 74.4 | 53.5 | 68.6 | 44.6 | 72.7 | 54.3 | |
| mLUKE-WScale=large, Input Features=words2021.10 | 74.3 | 84 | — | — | 70.3 | — | 66.2 | — | 70.2 | — | 74.2 | — | 69.7 | — | 72.7 | — | |
| XLM-Rsize=large2020.07 | 74.1 | 80.6 | 67.8 | 56 | 68.5 | 53.6 | 63.1 | 43.5 | 69.2 | 51.6 | 71.3 | 50.9 | 68 | 45.4 | 70.7 | 52.7 | |
| XLM-RFine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 74.1 | 80.6 | 67.8 | 56 | 68.5 | 53.6 | 63.1 | 43.5 | 69.2 | 51.6 | 71.3 | 50.9 | 68 | 45.4 | 70.7 | 52.7 | |
| mLUKE-EScale=base, Input Features=words+entities2021.10 | 70 | 80.8 | — | — | 65.5 | — | 60.8 | — | 63.7 | — | 68.4 | — | 66.2 | — | 67.9 | — | |
| INFOXLMsize=base2020.07 | 69.8 | 81.6 | 68.3 | 51.6 | 64.3 | 49.4 | 60.6 | 40.9 | 65.2 | 47.1 | 70.2 | 49 | 64.8 | 41.3 | 68.1 | 49.6 | |
| XLM-RScale=base, Extra Training=true2021.10 | 69.8 | 81.3 | — | — | 65 | — | 54.8 | — | 59.3 | — | 65.6 | — | 64.2 | — | 65.7 | — | |
| mLUKE-WScale=base, Input Features=words2021.10 | 69.7 | 81.3 | — | — | 65.4 | — | 60.4 | — | 63.2 | — | 68.3 | — | 66.1 | — | 67.8 | — | |
| INFOXLMsize=base, cross-lingual contrast=false2020.07 | 69.6 | 81.2 | 68.1 | 51.9 | 64 | 49.3 | 59.7 | 40.2 | 64 | 46.3 | 69.3 | 48 | 64.1 | 40.6 | 67.4 | 49.2 | |
| XLM-KScale=base2021.10 | 69.2 | 80.8 | — | — | 63.8 | — | 60 | — | 65.3 | — | 70.1 | — | 63.8 | — | 67.7 | — | |
| UNICODER2020.07 | 68.6 | 80.6 | — | — | 62.7 | — | 57.8 | — | 62.7 | — | 67.5 | — | 62.1 | — | 66 | — | |
| XLMsource=Lewis et al., 20202020.07 | 68 | 74.9 | 62.4 | 49.8 | 62.2 | 47.6 | 54.8 | 36.3 | 48.8 | 27.3 | 62.7 | 41.8 | 61.1 | 39.6 | 61.6 | 43.5 | |
| XLM-15Fine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 68 | 74.9 | 62.4 | 49.8 | 62.2 | 47.6 | 54.8 | 36.3 | 48.8 | 27.3 | 61.4 | 41.8 | 61.1 | 39.6 | 61.6 | 43.5 | |
| BEPA Monolingual (Ours)Fine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 67.8 | 81 | 68 | 46.1 | 62.4 | 46.4 | 55.5 | 36.6 | 64 | 46 | 68.6 | 47.6 | 41.3 | 40.6 | 62.9 | 47.3 | |
| BEPA Bilingual (Ours)Fine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 67.8 | 81.2 | 68.2 | 46.4 | 63.3 | 47.2 | 55.9 | 37 | 63.2 | 45.4 | 68.5 | 47.8 | 42.3 | 41.6 | 63.2 | 47.7 | |
| XLM-Rsize=base, reimpl=true2020.07 | 67.7 | 80.2 | 67 | 49.9 | 62.1 | 47.7 | 56.1 | 37.2 | 61.1 | 44 | 67 | 46.3 | 61.4 | 38.5 | 65.1 | 47.2 | |
| XLM-RScale=base2021.10 | 67.7 | 79.7 | — | — | 62.2 | — | 55.8 | — | 59.9 | — | 65.3 | — | 62.5 | — | 64.7 | — | |
| XLM-Rsize=base2020.07 | 67.4 | 77.1 | 64.6 | 49.6 | 60.9 | 46.7 | 54.9 | 36.6 | 59.4 | 42.9 | 64.5 | 44.7 | 61.8 | 39.3 | 63.7 | 46.3 | |
| XLM-R BaseFine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 67.4 | 77.1 | 64.6 | 49.6 | 60.9 | 46.7 | 54.9 | 36.6 | 59.4 | 42.9 | 64.5 | 44.7 | 61.8 | 39.3 | 63.7 | 46.3 | |
| XLM-RoBERTa (Ours)Fine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 66.8 | 80.9 | 68.2 | 45.8 | 62.4 | 46.8 | 55 | 35.9 | 61.7 | 44 | 67.4 | 47 | 40.3 | 39.6 | 62.1 | 46.8 | |
| mBERTScale=base2021.10 | 65.9 | 79.1 | — | — | 58.6 | — | 48.6 | — | 44.8 | — | 58.5 | — | 58.1 | — | 59.1 | — | |
| mBERTsource=Lewis et al., 20202020.07 | 64.3 | 77.7 | 65.2 | 46.6 | 57.9 | 44.3 | 45.7 | 29.8 | 43.8 | 29.7 | 57.1 | 38.6 | 57.5 | 37.3 | 57.7 | 41.6 | |
| mBERTFine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | 64.3 | 77.7 | 65.2 | 46.6 | 57.9 | 44.3 | 45.7 | 29.8 | 43.8 | 29.7 | 57.1 | 38.6 | 57.5 | 37.3 | 57.7 | 41.6 | |
| GPT-3 (All En)Evaluation Protocol=Contexts and questions in English, Parameters=175B2023.02 | 24.7 | — | — | — | 27.2 | — | 24 | — | 26.1 | — | 24.9 | — | 23.6 | — | — | — | |
| GPT-J (All En)Evaluation Protocol=Contexts and questions in English2023.02 | 24.3 | — | — | — | 27 | — | 23.6 | — | 23.9 | — | 23.3 | — | 23.1 | — | — | — | |
| ToolformerTool usage=enabled2023.02 | 20.6 | — | — | — | 13.5 | — | 3.7 | — | 1.4 | — | 10.6 | — | 16.8 | — | — | — | |
| Toolformer (disabled)Tool usage=disabled2023.02 | 19.8 | — | — | — | 11.9 | — | 3.1 | — | 1.2 | — | 10.1 | — | 15 | — | — | — | |
| GPT-J + CCPre-training=CCNet2023.02 | 15.7 | — | — | — | 14.9 | — | 4.6 | — | 0.5 | — | 8.3 | — | 13.7 | — | — | — | |
| GPT-J2023.02 | 15.2 | — | — | — | 16.5 | — | 8.2 | — | 1.3 | — | 8.2 | — | 18.2 | — | — | — | |
| GPT-3Parameters=175B2023.02 | 3.4 | — | — | — | 1.1 | — | 0.1 | — | 0.1 | — | 1.7 | — | 17.7 | — | — | — | |
| OPTParameters=66B2023.02 | 0.3 | — | — | — | 0.1 | — | 0.1 | — | 1.1 | — | 0.2 | — | 0.7 | — | — | — | |
| BERT-LargeFine-tuned on=English SQuAD, Evaluation=Zero-shot2026.01 | — | 80.2 | 67.4 | — | — | — | — | — | — | — | — | — | — | — | — | — |