Natural Language Inference on MultiNLI Matched
80.2AccuracyCAFE Ensemble
Evaluation Results
| Method | Links | |
|---|---|---|
| CAFE Ensembleensemble_size=5 models2017.12 | 80.2 | |
| Densely Interactive Inference Network2018.11 | 79.2 | |
| CAFE2017.12 | 78.7 | |
| Compare-Propagate Alignment-Factorized Encoders2018.11 | 78.7 | |
| ESIM + Readsource=Weissenborn, 20172017.12 | 77.8 | |
| ESIMsource=Weissenborn, 20172017.12 | 76.3 | |
| Chen et al.2018.11 | 74.9 | |
| Shortcut-Stacked Encoder2017.08 | 74.6 | |
| Nie and Bansal2018.11 | 74.6 | |
| Distance-Based Self-Attention Network2018.11 | 74.1 | |
| aESIMimplementation=implemented on Keras2018.12 | 73.9 | |
| ESIMimplementation=implemented on Keras2018.12 | 73.4 | |
| ESIMsource=Williams et al., 2017 / Khot et al., 20182017.12 | 72.4 | |
| Enhanced Sequential Inference Model2018.11 | 72.4 | |
| biLSTM-Max Encoderreimplementation=true2017.08 | 71.7 | |
| Stacked Bi-LSTMs + shortcut connections + max-poolinghidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 71.4 | |
| Directional Self-Attention Encoders2018.11 | 71 | |
| DiSAN2017.09 | 70.977 | |
| Bi-LSTM sentence encoder + max-pooling + attentionhidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 70.8 | |
| Bi-LSTM sentence encoder + max-poolinghidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 70.7 | |
| Stacked Bi-LSTMs + shortcut connections + max-pooling + attentionhidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 70.7 | |
| Bi-LSTM sentence encoder + attentionhidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 69.9 | |
| BiLSTM2017.12 | 69.8 | |
| Bi-GRU sentence encoder + attentionhidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 69.4 | |
| Stacked Bi-GRUs + shortcut connections + max-pooling + attentionhidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 68.9 | |
| Stacked Bi-GRUs + shortcut connections + max-poolinghidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 68.5 | |
| SWEM-max2018.05 | 68.2 | |
| SWEM-concat2018.05 | 67.9 | |
| Bi-LSTM2017.09 | 67.507 | |
| biLSTM Encoder2017.08 | 67.5 | |
| BiLSTM2018.11 | 67.5 | |
| Bi-GRU sentence encoder + max-pooling + attentionhidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 67.2 | |
| LSTMType=Bidirectional2018.05 | 66.9 | |
| Bi-LSTMsource=baseline from [17]2018.12 | 66.9 | |
| SWEM-aver2018.05 | 66.5 | |
| Bi-GRU sentence encoder + max-poolinghidden_state_dim=300, bidirectional_dim=600, optimizer=Adam2018.11 | 66.5 | |
| CBOW2017.09 | 65.2 | |
| CBOW2017.08 | 65.2 | |
| CBOW2017.12 | 65.2 | |
| Continuous BOW (Averaging Word Embeddings)2018.11 | 65.2 | |
| CNN2018.05 | 65 | |
| CBOWsource=baseline from [17]2018.12 | 64.8 | |
| LaMini-LLaMA# of params=7B2023.04 | 63.8 | |
| LaMini-GPT-J# of params=6B2023.04 | 57.7 | |
| Alpaca# of params=7B2023.04 | 38.8 | |
| GPT-J# of params=6B2023.04 | 37.4 | |
| Majority2017.12 | 36.5 | |
| Most Frequent Class2018.11 | 36.5 | |
| LLaMA# of params=7B2023.04 | 34.4 |