Sentiment Classification on CR
91.4AccuracyBYTE MLSTM
Evaluation Results
| Method | Links | |
|---|---|---|
| BYTE MLSTMClassifier=Logistic Regression, Penalty=L12017.04 | 91.4 | |
| byte mLSTMd*=40962018.05 | 90.6 | |
| SBERT2025.12 | 90 | |
| CNN+MCFAAdditional Context=Translation, N=ensemble2018.06 | 89.4 | |
| RoBERTa (Gao et al., 2021)# Params=1.0x, Evaluation Protocol=Full fine-tuning2022.12 | 89.4 | |
| CNN+MCFAAdditional Context=Translation, N=102018.06 | 88.6 | |
| SCD-RoBERTa_baseBackbone=RoBERTa-base2022.03 | 87.76 | |
| CNN+MCFAAdditional Context=Translation, N=12018.06 | 87.6 | |
| USE_T+CNN (w2v w.e.)Universal Encoder=Transformer (USE_T), Transfer Level=Sentence & Word, Embedding Initialization=word2vec skip-gram, Transfer Task Model=CNN2018.03 | 87.45 | |
| USE TUniversal Encoder=Transformer (USE_T), Transfer Level=Sentence, Embedding Initialization=None, Transfer Task Model=None2018.03 | 87.43 | |
| BERT [CLS]-embeddingBackbone=BERT-base, Pooling=CLS2022.03 | 87.39 | |
| SimCSE-RoBERTa_baseBackbone=RoBERTa-base2022.03 | 87.28 | |
| IS-BERT_baseBackbone=BERT-base2022.03 | 87.18 | |
| CNN+B1Additional Context=Translation, N=ensemble2018.06 | 86.7 | |
| USE_T+DAN (w2v w.e.)Universal Encoder=Transformer (USE_T), Transfer Level=Sentence & Word, Embedding Initialization=word2vec skip-gram, Transfer Task Model=DAN2018.03 | 86.66 | |
| CNN+B2Additional Context=Translation, N=ensemble2018.06 | 86.6 | |
| USE_T+CNN (lrn w.e.)Universal Encoder=Transformer (USE_T), Transfer Level=Sentence, Embedding Initialization=learned on transfer task, Transfer Task Model=CNN2018.03 | 86.45 | |
| TopCNNAdditional Context=Topic, Granularity=ensemble2018.06 | 86.4 | |
| AdaSent2018.06 | 86.3 | |
| CNN+B2Additional Context=Translation, N=102018.06 | 86.3 | |
| BiLSTM-Max (on AllNLI)Training Methodology=Supervised, Source Dataset=AllNLI2017.05 | 86.3 | |
| AdaSentTraining Methodology=Supervised, Transfer Protocol=No Transfer2017.05 | 86.3 | |
| AdaSent2015.04 | 86.3 | |
| ADASENT2017.04 | 86.3 | |
| Avg. BERT embeddingsBackbone=BERT-base, Pooling=Avg2022.03 | 86.25 | |
| CNN+B1Additional Context=Translation, N=12018.06 | 86.2 | |
| CNN+B2Additional Context=Translation, N=12018.06 | 86.1 | |
| USE_T+DAN (lrn w.e.)Universal Encoder=Transformer (USE_T), Transfer Level=Sentence, Embedding Initialization=learned on transfer task, Transfer Task Model=DAN2018.03 | 86.08 | |
| MC-QTd*=48002018.05 | 86 | |
| CNN+B1Additional Context=Translation, N=102018.06 | 85.9 | |
| SCD-BERT_baseBackbone=BERT-base2022.03 | 85.8 | |
| SimCSE-BERT_baseBackbone=BERT-base2022.03 | 85.75 | |
| CNN-Rule-qNetwork role=teacher network, Rule type=but-rule2016.03 | 85.3 | |
| Capsule-B2018.03 | 85.1 | |
| CNN-multichannelword vectors=pre-trained (word2vec), channels=22014.08 | 85 | |
| CNN2018.06 | 85 | |
| CNN2015.04 | 85 | |
| CNN2017.04 | 85 | |
| CNN-Rule-pNetwork role=student network, Rule type=but-rule2016.03 | 85 | |
| CNN-multichannel2016.03 | 85 | |
| TopCNNAdditional Context=Topic, Granularity=word2018.06 | 84.9 | |
| TopCNNAdditional Context=Topic, Granularity=sentence2018.06 | 84.8 | |
| RoBERTa [CLS]-embeddingBackbone=RoBERTa-base, Pooling=CLS2022.03 | 84.77 | |
| CNN-staticword vectors=static pre-trained (word2vec)2014.08 | 84.7 | |
| CNNmode=static2018.03 | 84.7 | |
| CNN-non-staticword vectors=fine-tuned pre-trained (word2vec)2014.08 | 84.3 | |
| à la carten=3, d*=48002018.05 | 84.3 | |
| CNNmode=non-static2018.03 | 84.3 | |
| CNNModel variant=non-static2016.03 | 84.3 | |
| GPT-2 kNN-LM# Params=2.2x, Evaluation Protocol=Zero-shot2022.12 | 84.3 | |
| CNN-400Emb.Size=4002019.05 | 83.82 | |
| NLM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 83.82 | |
| skip-thoughtsd*=48002018.05 | 83.8 | |
| Capsule-A2018.03 | 83.8 | |
| à la carten=2, d*=32002018.05 | 83.7 | |
| SCLie2025.12 | 83.6 | |
| STM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 83.57 | |
| LM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 83.54 | |
| LM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 83.4 | |
| NLM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 83.32 | |
| Tree-LSTM2018.03 | 83.2 | |
| SkipThought-LNTraining Methodology=Unsupervised, Sentence Ordering=Ordered, Transfer Protocol=Transfer2017.05 | 83.1 | |
| SKIPTHOUGHTLayer Normalization=True2017.04 | 83.1 | |
| NLM+TSEDEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 83.04 | |
| LSTM-400Emb.Size=4002019.05 | 82.98 | |
| NLM+TSEDEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 82.96 | |
| STM+TSEDEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 82.96 | |
| GPT-2 + PMI# Params=2.2x, Evaluation Protocol=Zero-shot2022.12 | 82.8 | |
| LM+TSEDEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 82.76 | |
| STM+TSED+PT+2LEmb.Size=50, Teacher Model Architecture=LSTM2019.05 | 82.73 | |
| CRF-PR2014.08 | 82.7 | |
| CRF-PR2016.03 | 82.7 | |
| BRNN2015.04 | 82.6 | |
| DPCLie2025.12 | 82.6 | |
| LR-LSTM2018.03 | 82.5 | |
| DPCNN2025.12 | 82.4 | |
| RNN2015.04 | 82.3 | |
| G-Dropout2014.08 | 82.1 | |
| BILSTM2018.03 | 82.1 | |
| G-Dropout2016.03 | 82.1 | |
| USE_D+CNN (w2v w.e.)Universal Encoder=Deep Averaging Network (USE_D), Transfer Level=Sentence & Word, Embedding Initialization=word2vec skip-gram, Transfer Task Model=CNN2018.03 | 82.04 | |
| CNN-LSTMd*=48002018.05 | 82 | |
| USE_D+DAN (lrn w.e.)Universal Encoder=Deep Averaging Network (USE_D), Transfer Level=Sentence, Embedding Initialization=learned on transfer task, Transfer Task Model=DAN2018.03 | 81.93 | |
| F-Dropout2014.08 | 81.9 | |
| LM+TSEDEmb.Size=50, Teacher Model Architecture=CNN2019.05 | 81.84 | |
| NBSVM2014.08 | 81.8 | |
| NB-SVM2015.04 | 81.8 | |
| NBSVM2017.04 | 81.8 | |
| SKIPTHOUGHT2017.04 | 81.8 | |
| LinearArchitecture=Fully connected Neural Network replacement for Convolution layer2025.12 | 81.8 | |
| USE_D+DAN (w2v w.e.)Universal Encoder=Deep Averaging Network (USE_D), Transfer Level=Sentence & Word, Embedding Initialization=word2vec skip-gram, Transfer Task Model=DAN2018.03 | 81.71 | |
| DisCn=2-3, d*=3200-48002018.05 | 81.5 | |
| SCNN2025.12 | 81.5 | |
| USE_D+CNN (lrn w.e.)Universal Encoder=Deep Averaging Network (USE_D), Transfer Level=Sentence, Embedding Initialization=learned on transfer task, Transfer Task Model=CNN2018.03 | 81.49 | |
| Tree-CRF2014.08 | 81.4 | |
| à la carten=1, d*=16002018.05 | 81.3 | |
| GrConv2015.04 | 81.3 | |
| NPM# Params=1.0x, Evaluation Protocol=Zero-shot, nonparametric=true2022.12 | 81.2 | |
| USE DUniversal Encoder=Deep Averaging Network (USE_D), Transfer Level=Sentence, Embedding Initialization=None, Transfer Task Model=None2018.03 | 80.97 | |
| CNN-50Emb.Size=502019.05 | 80.89 |