Causal Reasoning on XCOPA (test)
96.4Accuracy (th)PaLM 2
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| PaLM 2source=Ours, shots=4-shot2023.05 | 96.4 | 94.4 | — | 97.6 | 91.4 | 97.2 | 98.4 | 76.8 | 92.8 | 96.2 | 97.8 | 96.8 | 97.4 | — | — | — | |
| PaLM CoTsource=Shi et al., shots=4-shot2023.05 | 90.2 | 89.9 | — | 91 | 89.6 | 94 | 97.4 | 66.8 | 85.4 | 90.8 | 94.6 | 94.6 | 94.8 | — | — | — | |
| PaLMsource=Shi et al., shots=4-shot2023.05 | 87.2 | 83.7 | — | 77.4 | 78 | 92.6 | 96 | 61 | 69.4 | 85.4 | 92.8 | 89.8 | 91.6 | — | — | — | |
| PaLMsource=Ours, shots=4-shot2023.05 | 86.8 | 83 | — | 75.6 | 77.2 | 92.2 | 95.8 | 60.6 | 68.8 | 84 | 92.4 | 89.4 | 90.6 | — | — | — | |
| XLM-R Base MLM-TRGBackbone=XLM-R Base, Fine-tuning Protocol=Fine-tuned on SIQA and then on English COPA training set, Adaptation=Masked Language Modeling on Target Language (MLM-TRG)2020.04 | 62.2 | 61.2 | 66.8 | 59.4 | 50 | 71 | 61.6 | 46 | 58.8 | 60 | 63.2 | 67.6 | 67.4 | — | — | — | |
| MAD-X BaseBackbone=XLM-R Base, Fine-tuning Protocol=Fine-tuned on SIQA and then on English COPA training set, Components=Language Adapters, Task Adapters, Invertible Adapters2020.04 | 60.3 | 61.5 | 68.3 | 61.3 | 53.7 | 65.8 | 63 | 52.5 | 56.3 | 61.9 | 61.8 | 66.1 | 67.6 | — | — | — | |
| Bactrian-MParameters=7B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 57.4 | — | — | — | — | 60.2 | — | — | 53.2 | — | 53.4 | 59.4 | — | — | — | — | |
| X-InstructionParameters=7B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 57.4 | — | — | — | — | 61.4 | — | — | 56 | — | 55.6 | 60.4 | — | — | — | — | |
| LLAMA 2Parameters=7B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 57.2 | — | — | — | — | 58.2 | — | — | 51.8 | — | 53 | 57 | — | — | — | — | |
| X-InstructionParameters=13B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 57 | — | — | — | — | 62 | — | — | 58.8 | — | 56.6 | 62.8 | — | — | — | — | |
| Bactrian-MParameters=13B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 56.8 | — | — | — | — | 62.8 | — | — | 53.8 | — | 55.8 | 62.2 | — | — | — | — | |
| XLM-R BaseBackbone=XLM-R Base, Fine-tuning Protocol=Fine-tuned on SIQA and then on English COPA training set2020.04 | 56.6 | 59.7 | 66.8 | 58 | 51.4 | 65 | 60.2 | 51.2 | 52 | 58.4 | 62 | 65.6 | 68.8 | — | — | — | |
| LLAMA 2Parameters=13B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 56.2 | — | — | — | — | 61.6 | — | — | 52.6 | — | 55 | 60.6 | — | — | — | — | |
| TokAlign++Backbone=Pythia 1B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 56.2 | — | — | — | — | — | — | — | — | 54.4 | — | 54.2 | — | — | — | — | |
| PythiaBackbone=Pythia 6.9B, Tuning Stage=Vanilla (Zero-shot)2026.05 | 56.2 | — | — | — | — | — | — | — | — | 52.2 | — | 54.4 | — | — | — | — | |
| TokAlignBackbone=Pythia 1B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 55.6 | — | — | — | — | — | — | — | — | 52.8 | — | 52.8 | — | — | — | — | |
| TokAlign++Backbone=Pythia 6.9B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 55.2 | — | — | — | — | — | — | — | — | 54.8 | — | 57.4 | — | — | — | — | |
| ZeTTBackbone=Pythia 6.9B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 55 | — | — | — | — | — | — | — | — | 53.8 | — | 54 | — | — | — | — | |
| ZeTTBackbone=Pythia 1B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 54.8 | — | — | — | — | — | — | — | — | 52.4 | — | 53.6 | — | — | — | — | |
| TokAlignBackbone=Pythia 6.9B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 54.4 | — | — | — | — | — | — | — | — | 54 | — | 56.2 | — | — | — | — | |
| PythiaBackbone=Pythia 1B, Tuning Stage=Vanilla (Zero-shot)2026.05 | 54 | — | — | — | — | — | — | — | — | 55.4 | — | 53.2 | — | — | — | — | |
| FocusBackbone=Pythia 1B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 53.8 | — | — | — | — | — | — | — | — | 54.2 | — | 52.2 | — | — | — | — | |
| FocusBackbone=Pythia 6.9B, Tuning Stage=Initialization without any tuning2026.05 | 53.8 | — | — | — | — | — | — | — | — | 53.8 | — | 51 | — | — | — | — | |
| TokAlignBackbone=Pythia 6.9B, Tuning Stage=Initialization without any tuning2026.05 | 53.8 | — | — | — | — | — | — | — | — | 57.2 | — | 51.8 | — | — | — | — | |
| FocusBackbone=Pythia 6.9B, Tuning Stage=1k steps tuning on multilingual corpus2026.05 | 53.8 | — | — | — | — | — | — | — | — | 52.6 | — | 54.4 | — | — | — | — | |
| TokAlign++Backbone=Pythia 1B, Tuning Stage=Initialization without any tuning2026.05 | 53.4 | — | — | — | — | — | — | — | — | 55.4 | — | 52.2 | — | — | — | — | |
| TokAlign++Backbone=Pythia 6.9B, Tuning Stage=Initialization without any tuning2026.05 | 53.4 | — | — | — | — | — | — | — | — | 54.6 | — | 53.4 | — | — | — | — | |
| ZeTTBackbone=Pythia 6.9B, Tuning Stage=Initialization without any tuning2026.05 | 53.2 | — | — | — | — | — | — | — | — | 54.4 | — | 50.2 | — | — | — | — | |
| FocusBackbone=Pythia 1B, Tuning Stage=Initialization without any tuning2026.05 | 52.4 | — | — | — | — | — | — | — | — | 54.4 | — | 48.6 | — | — | — | — | |
| TokAlignBackbone=Pythia 1B, Tuning Stage=Initialization without any tuning2026.05 | 52.4 | — | — | — | — | — | — | — | — | 54.8 | — | 50.4 | — | — | — | — | |
| ZeTTBackbone=Pythia 1B, Tuning Stage=Initialization without any tuning2026.05 | 51.6 | — | — | — | — | — | — | — | — | 54 | — | 49.8 | — | — | — | — | |
| baselineModel=GPT-4o2025.02 | — | 84.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoTModel=GPT-4o2025.02 | — | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMCEE (Ours)Prompting Method=EMCEE (Ours), Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 92 | 96.8 | 86.2 | |
| EMCEE (ROUTE)Prompting Method=EMCEE (ROUTE), Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 90.5 | 96 | 83.8 | |
| ENG-BASICPrompting Method=ENG-BASIC, Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 55.3 | 57.3 | 52.8 | |
| ENG-COTPrompting Method=ENG-COT, Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 90.5 | 96 | 83.8 | |
| NATIVE-BASICPrompting Method=NATIVE-BASIC, Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.3 | 94.2 | 61.4 | |
| NATIVE-COTPrompting Method=NATIVE-COT, Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 90 | 96.3 | 82.4 | |
| QuaSARModel=GPT-4o2025.02 | — | 89.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RAG (ENG)Prompting Method=RAG (ENG), Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 87.9 | 94 | 80.6 | |
| RAG (NATIVE)Prompting Method=RAG (NATIVE), Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.6 | 92.3 | 73.2 | |
| TRANS-GOOGLEPrompting Method=TRANS-GOOGLE, Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 66 | 65.2 | 67.3 | |
| XLTPrompting Method=XLT, Backbone=GPT-4o-mini2025.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | 91.1 | 95.8 | 85.4 |