Sentiment Classification on IMDB (test)
0.0651Error RateOur best (three tv-embeddings)
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Our best (three tv-embeddings)Extra resource=Unlabeled data2015.04 | 0.0651 | — | — | — | — | — | — | — | — | — | — | |
| Ensemble of 3 modelsExtra resource=Ensemble + unlabeled data2015.04 | 0.0743 | — | — | — | — | — | — | — | — | — | — | |
| Paragraph vectorsExtra resource=Unlabeled data2015.04 | 0.0746 | — | — | — | — | — | — | — | — | — | — | |
| best CNN2015.04 | 0.0767 | — | — | — | — | — | — | — | — | — | — | |
| NB-LM 1-3grams2015.04 | 0.0813 | — | — | — | — | — | — | — | — | — | — | |
| XLNetArchitecture=24-layer, Model size=Large2019.06 | 3.2 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=62026.02 | 3.27 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=52026.02 | 3.35 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=72026.02 | 3.35 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=32026.02 | 3.39 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=32026.02 | 3.39 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=42026.02 | 3.4 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=52026.02 | 3.41 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=62026.02 | 3.44 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=42026.02 | 3.45 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=32026.02 | 3.47 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=72026.02 | 3.49 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=82026.02 | 3.5 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=12026.02 | 3.51 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=12026.02 | 3.51 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=22026.02 | 3.51 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=12026.02 | 3.51 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=12026.02 | 3.54 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=22026.02 | 3.54 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=32026.02 | 3.58 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=42026.02 | 3.6 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=42026.02 | 3.6 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=82026.02 | 3.6 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=22026.02 | 3.62 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=22026.02 | 3.63 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=92026.02 | 3.67 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=92026.02 | 3.76 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=52026.02 | 3.77 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=52026.02 | 3.77 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=102026.02 | 3.82 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=62026.02 | 3.87 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=62026.02 | 3.87 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=102026.02 | 3.91 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=92026.02 | 3.92 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=72026.02 | 3.92 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=92026.02 | 3.92 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=72026.02 | 3.97 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=82026.02 | 3.98 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=82026.02 | 3.98 | — | — | — | — | — | — | — | — | — | — | |
| Graph StarTraining Protocol=Semi-supervised via large-scale pre-training, Training Data=Massive external data2017.05 | 4 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=102026.02 | 4.03 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=102026.02 | 4.03 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=112026.02 | 4.04 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=112026.02 | 4.05 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=112026.02 | 4.11 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=112026.02 | 4.11 | — | — | — | — | — | — | — | — | — | — | |
| Top-k (Acc)k=122026.02 | 4.13 | — | — | — | — | — | — | — | — | — | — | |
| Term 1 (Rel)k=122026.02 | 4.13 | — | — | — | — | — | — | — | — | — | — | |
| Terms 1+2 (mRMR)k=122026.02 | 4.13 | — | — | — | — | — | — | — | — | — | — | |
| Greedy MIk=122026.02 | 4.13 | — | — | — | — | — | — | — | — | — | — | |
| BERT-largeTraining Protocol=Semi-supervised via large-scale pre-training, Training Data=Massive external data2017.05 | 4.2 | — | — | — | — | — | — | — | — | — | — | |
| BERT-ITPT-FiTBackbone=BERT-Large, Further pre-training=In-Task (ITPT)2019.05 | 4.21 | — | — | — | — | — | — | — | — | — | — | |
| Mixed VAT2019.06 | 4.32 | — | — | — | — | — | — | — | — | — | — | |
| Mixed-objective LSTMTraining Protocol=Semi-supervised via large-scale pre-training, Training Data=Massive external data2017.05 | 4.32 | — | — | — | — | — | — | — | — | — | — | |
| Mixed VATSequence Length=5122019.04 | 4.32 | — | — | — | — | — | — | — | — | — | — | |
| BERT-ITPT-FiTconfiguration=BERT + withIn-Task Pre-Training + Fine-Tuning2019.05 | 4.37 | — | — | — | — | — | — | — | — | — | — | |
| BERT-ITPT-FiTBackbone=BERT-Base, Further pre-training=In-Task (ITPT)2019.05 | 4.37 | — | — | — | — | — | — | — | — | — | — | |
| MPNetModel setting=BERT_BASE, Pre-training data size=160GB2020.04 | 4.4 | — | — | — | — | — | — | — | — | — | — | |
| BERTArchitecture=24-layer, Model size=Large2019.06 | 4.51 | — | — | — | — | — | — | — | — | — | — | |
| BERT_LARGESequence Length=5122019.04 | 4.51 | — | — | — | — | — | — | — | — | — | — | |
| ULMFiT2018.01 | 4.6 | — | — | — | — | — | — | — | — | — | — | |
| ULMFIT2019.06 | 4.6 | — | — | — | — | — | — | — | — | — | — | |
| ULMFIT2019.05 | 4.6 | — | — | — | — | — | — | — | — | — | — | |
| ULMFiT2019.05 | 4.6 | — | — | — | — | — | — | — | — | — | — | |
| ULMFiTTraining Protocol=Semi-supervised via large-scale pre-training, Training Data=Massive external data2017.05 | 4.6 | — | — | — | — | — | — | — | — | — | — | |
| MPNetModel setting=BERT_BASE, Pre-training data size=16GB (Wikipedia and BooksCorpus)2020.04 | 4.8 | — | — | — | — | — | — | — | — | — | — | |
| BERT-FiTBackbone=BERT-Large2019.05 | 4.86 | — | — | — | — | — | — | — | — | — | — | |
| BERT-IDPT-FiTconfiguration=BERT + In-Domain Pre-Training + Fine-Tuning2019.05 | 4.88 | — | — | — | — | — | — | — | — | — | — | |
| XLNetModel setting=BERT_BASE, Pre-training data size=16GB (Wikipedia and BooksCorpus)2020.04 | 4.9 | — | — | — | — | — | — | — | — | — | — | |
| block-sparse LSTMTraining Protocol=Semi-supervised via large-scale pre-training, Training Data=Massive external data2017.05 | 5.01 | — | — | — | — | — | — | — | — | — | — | |
| BERT-CDPT-FiTconfiguration=BERT + Cross-Domain Pre-Training + Fine-Tuning2019.05 | 5.18 | — | — | — | — | — | — | — | — | — | — | |
| BERT-FiTconfiguration=BERT + Fine-Tuning2019.05 | 5.4 | — | — | — | — | — | — | — | — | — | — | |
| BERT-FiTBackbone=BERT-Base2019.05 | 5.4 | — | — | — | — | — | — | — | — | — | — | |
| BERTModel setting=BERT_BASE, Pre-training data size=16GB (Wikipedia and BooksCorpus)2020.04 | 5.4 | — | — | — | — | — | — | — | — | — | — | |
| CEN-tpcTraining Protocol=Semi-supervised, Training Data=25K labeled + 50K unlabeled reviews2017.05 | 5.48 | — | — | — | — | — | — | — | — | — | — | |
| oh-LSTM2018.01 | 5.9 | — | — | — | — | — | — | — | — | — | — | |
| Virtual2018.01 | 5.9 | — | — | — | — | — | — | — | — | — | — | |
| Virtual Adv2017.04 | 5.91 | — | — | — | — | — | — | — | — | — | — | |
| Virtual Adversarial2016.05 | 5.91 | — | — | — | — | — | — | — | — | — | — | |
| Virtual AdversarialBackbone=bidirectional LSTM2016.05 | 5.91 | — | — | — | — | — | — | — | — | — | — | |
| oh-2LSTMpTraining Protocol=Semi-supervised, Training Data=25K labeled + 50K unlabeled reviews2017.05 | 5.94 | — | — | — | — | — | — | — | — | — | — | |
| Virtual adversarialTraining Protocol=Semi-supervised, Training Data=25K labeled + 50K unlabeled reviews2017.05 | 5.94 | — | — | — | — | — | — | — | — | — | — | |
| One-hot bi-LSTMPretrained embeddings=true2016.05 | 5.94 | — | — | — | — | — | — | — | — | — | — | |
| Adversarial + Virtual AdversarialBackbone=bidirectional LSTM2016.05 | 6.02 | — | — | — | — | — | — | — | — | — | — | |
| Adversarial + Virtual Adversarial2016.05 | 6.09 | — | — | — | — | — | — | — | — | — | — | |
| Adversarial2016.05 | 6.21 | — | — | — | — | — | — | — | — | — | — | |
| TopicRNN2017.04 | 6.24 | — | — | — | — | — | — | — | — | — | — | |
| CEN-tpcTraining Protocol=Supervised, Training Data=25K labeled reviews only2017.05 | 6.24 | — | — | — | — | — | — | — | — | — | — | |
| TopicRNNTraining Protocol=Semi-supervised, Training Data=25K labeled + 50K unlabeled reviews2017.05 | 6.28 | — | — | — | — | — | — | — | — | — | — | |
| oh-CNNTraining Protocol=Semi-supervised, Training Data=25K labeled + 50K unlabeled reviews2017.05 | 6.51 | — | — | — | — | — | — | — | — | — | — | |
| CEN-bowTraining Protocol=Supervised, Training Data=25K labeled reviews only2017.05 | 6.52 | — | — | — | — | — | — | — | — | — | — | |
| oh-2LSTMpUnlabeled data usage=2x100-dim LSTM tv-embed.2016.02 | 6.66 | — | — | — | — | — | — | — | — | — | — | |
| Random perturbationTraining setting=labeled and unlabeled examples2016.05 | 6.78 | — | — | — | — | — | — | — | — | — | — | |
| BERT-Featconfiguration=BERT as features2019.05 | 6.79 | — | — | — | — | — | — | — | — | — | — | |
| oh-CNNUnlabeled data usage=1x200-dim CNN tv-embed.2016.02 | 6.81 | — | — | — | — | — | — | — | — | — | — |