Sentiment Classification on SST-2 (test)
91.8Accuracybyte mLSTM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| byte mLSTMpre-trained on large external corpora=true2018.09 | 91.8 | — | |
| Bi-CAS-LSTMlayers=22018.09 | 91.3 | — | |
| CAS-LSTMlayers=22018.09 | 91.1 | — | |
| Gumbel Tree-LSTM2018.09 | 90.7 | — | |
| CNN-RNF-GRUCategory=CNN variants, Word Vectors=GloVe 300d2018.08 | 90 | — | |
| CNN-RNF-LSTMCategory=CNN variants, Word Vectors=GloVe 300d2018.08 | 90 | — | |
| Lei et al., 2017Description=Best published results2018.08 | 89.9 | — | |
| LSTM-maxpoolCategory=RNN variants, Word Vectors=GloVe 300d2018.08 | 89.8 | — | |
| GRU-maxpoolCategory=RNN variants, Word Vectors=GloVe 300d2018.08 | 89.7 | — | |
| SRU (4 layers)Size=303k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 89.6 | 510 | |
| Constituency Tree-LSTMrecurrent dropout=true2018.09 | 89.4 | — | |
| NTI-SLSTM-LSTMleaf_function=SLSTM, composition_function=LSTM2016.07 | 89.3 | — | |
| LSTMCategory=RNN variants, Word Vectors=GloVe 300d2018.08 | 89.3 | — | |
| SRU (2 layers)Size=204k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 89.2 | 320 | |
| QRNN (k=1) + highwaySize=204k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 88.9 | 371 | |
| SRU (8 layers)Size=502k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 88.9 | 879 | |
| GRUCategory=RNN variants, Word Vectors=GloVe 300d2018.08 | 88.7 | — | |
| Molding-CNN2015.11 | 88.6 | — | |
| DMN2015.06 | 88.6 | — | |
| T-CNN2016.01 | 88.6 | — | |
| DMN2016.07 | 88.6 | — | |
| QRNN (k=1)Size=165k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 88.2 | 345 | |
| CNN-multichannel2015.11 | 88.1 | — | |
| CNN2018.05 | 88.1 | — | |
| CNN-MC2015.06 | 88.1 | — | |
| CNN-MC2016.01 | 88.1 | — | |
| CNN-MC2016.07 | 88.1 | — | |
| Kim (2014)2017.09 | 88.1 | — | |
| LSTMSize=352k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 88.1 | 2,409 | |
| Constituency Tree-LSTM2015.11 | 88 | — | |
| Constituency Tree-LSTM2018.05 | 88 | — | |
| CT-LSTM2015.06 | 88 | — | |
| CT-LSTMmemory size=1682016.01 | 88 | — | |
| CT-LSTMtype=Constituency Tree2016.07 | 88 | — | |
| Constituency Tree-LSTM2018.09 | 88 | — | |
| Bi-LSTMimplementation=author implementation2015.11 | 87.9 | — | |
| Paragraph Vector2015.11 | 87.8 | — | |
| C-LSTM2015.11 | 87.8 | — | |
| PVec2015.06 | 87.8 | — | |
| PV2016.01 | 87.8 | — | |
| NTI-SLSTMleaf_function=SLSTM2016.07 | 87.8 | — | |
| Bi-LSTMbidirectional=true2016.07 | 87.5 | — | |
| CNN-non-static2015.11 | 87.2 | — | |
| BiLSTMlayers=22018.09 | 87.2 | — | |
| 2-layer LSTMNlayers=2, memory size=1682016.01 | 87 | — | |
| STM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 86.95 | — | |
| DCNN2015.11 | 86.8 | — | |
| Dynamic CNN2018.05 | 86.8 | — | |
| DCNN2015.06 | 86.8 | — | |
| DCNN2016.01 | 86.8 | — | |
| Kalchbrenner et al. (2014)2017.09 | 86.8 | — | |
| DRNN2015.11 | 86.6 | — | |
| LSTMimplementation=author implementation2015.11 | 86.6 | — | |
| DRNN2015.06 | 86.6 | — | |
| DRNN2016.01 | 86.6 | — | |
| DRNN2016.07 | 86.6 | — | |
| 2-layer LSTMlayers=2, memory size=1682016.01 | 86.3 | — | |
| LSTMNmemory size=1682016.01 | 86.3 | — | |
| 2-layer LSTMlayers=22016.07 | 86.3 | — | |
| LSTMlayers=22018.09 | 86.3 | — | |
| CNN-400Emb.Size=4002019.05 | 86.22 | — | |
| LSTM-400Emb.Size=4002019.05 | 86.22 | — | |
| LM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 86.12 | — | |
| STM+TSEDEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 86.11 | — | |
| CNN-linear-filterCategory=CNN variants, Word Vectors=GloVe 300d2018.08 | 86.1 | — | |
| NLM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 85.89 | — | |
| STM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 85.83 | — | |
| LM+TSEDEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 85.81 | — | |
| LM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 85.75 | — | |
| Dependency Tree-LSTM2015.11 | 85.7 | — | |
| DAN-ROOT2018.05 | 85.7 | — | |
| NLM+TSEDEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 85.55 | — | |
| Zhang and Wallace (2017)2017.09 | 85.5 | — | |
| RNTN2015.11 | 85.4 | — | |
| RNTN2015.06 | 85.4 | — | |
| RNTN2016.01 | 85.4 | — | |
| RNTN2016.07 | 85.4 | — | |
| Recursive Neural Tensor Network2018.09 | 85.4 | — | |
| NLM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 85.31 | — | |
| NLM+TSEDEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 85.17 | — | |
| CNNSize=360k, Optimizer=Adam, Word embeddings=fixed, Number of runs=52017.09 | 85.1 | 417 | |
| LM+TSEDEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 85.04 | — | |
| LSTM2018.05 | 84.9 | — | |
| LSTMmemory size=1682016.01 | 84.9 | — | |
| STM+TSEDEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 84.72 | — | |
| CNN-50Emb.Size=502019.05 | 84.51 | — | |
| SWEM-concat2018.05 | 84.3 | — | |
| SWEM-aver2018.05 | 83.9 | — | |
| ENCEmb.Size=502019.05 | 83.71 | — | |
| SWEM-max2018.05 | 83.6 | — | |
| LSTM-50Emb.Size=502019.05 | 83.36 | — | |
| MV-RNN2015.11 | 82.9 | — | |
| MV-RNN2018.05 | 82.9 | — | |
| MV-RNN2015.06 | 82.9 | — | |
| RAE2015.11 | 82.4 | — | |
| RAE2018.05 | 82.4 | — | |
| RAE2016.01 | 82.4 | — | |
| NBOW2015.11 | 80.5 | — | |
| SVM2015.11 | 79.4 | — | |
| Switch-ACMoEPre-training dataset=WikiText-103, Task=Finetuning2025.02 | 77.32 | — |