Cross-lingual Natural Language Inference on XNLI (test)
74.3Accuracy (All)EMCEE (Ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EMCEE (Ours)Prompting Method=EMCEE (Ours), Backbone=GPT-4o-mini2025.03 | 74.3 | 74.7 | 73.9 | |
| ENG-COTPrompting Method=ENG-COT, Backbone=GPT-4o-mini2025.03 | 73.2 | 73.7 | 72.7 | |
| EMCEE (ROUTE)Prompting Method=EMCEE (ROUTE), Backbone=GPT-4o-mini2025.03 | 73.1 | 73.9 | 72.3 | |
| XLTPrompting Method=XLT, Backbone=GPT-4o-mini2025.03 | 72.6 | 74.3 | 71 | |
| ENG-BASICPrompting Method=ENG-BASIC, Backbone=GPT-4o-mini2025.03 | 71.4 | 74.6 | 68.1 | |
| TRANS-GOOGLEPrompting Method=TRANS-GOOGLE, Backbone=GPT-4o-mini2025.03 | 70.5 | 73.4 | 67.6 | |
| RAG (ENG)Prompting Method=RAG (ENG), Backbone=GPT-4o-mini2025.03 | 70.4 | 71.1 | 69.7 | |
| NATIVE-COTPrompting Method=NATIVE-COT, Backbone=GPT-4o-mini2025.03 | 68.4 | 70.1 | 66.6 | |
| RAG (NATIVE)Prompting Method=RAG (NATIVE), Backbone=GPT-4o-mini2025.03 | 67.4 | 69.9 | 64.9 | |
| NATIVE-BASICPrompting Method=NATIVE-BASIC, Backbone=GPT-4o-mini2025.03 | 66.2 | 74 | 58.4 |