Text Classification on IMDB (test)
96.8CAProtoformer
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Protoformer2022.06 | 96.8 | — | — | — | — | 96.4 | 95.2 | |
| RoBERTa2022.06 | 95.7 | — | — | — | — | 95.2 | 94.1 | |
| BERT2021.05 | 95.4 | — | — | — | — | — | — | |
| StandardModel=RoBERTa-base2021.12 | 94.9 | — | — | — | — | — | — | |
| CHARFORMER SBaseTokenization=Character, Parameters=134M2021.06 | 94.4 | — | — | — | — | — | — | |
| T5 Base, SubwordTokenization=Subword, Parameters=220M2021.06 | 94.2 | — | — | — | — | — | — | |
| DocBERT2022.06 | 93.6 | — | — | — | — | 93.2 | 92.1 | |
| SAFERModel=BERT2025.07 | 93.5 | 9.5 | — | — | — | — | — | |
| PGD-KModel=BERT2025.07 | 93.2 | 26 | — | — | — | — | — | |
| RanMASKModel=BERT2025.07 | 93.2 | 22 | — | — | — | — | — | |
| FreeLB++Model=BERT2025.07 | 93.2 | 45.3 | — | — | — | — | — | |
| StandardModel=BERT-base-uncased2021.12 | 93.1 | — | — | — | — | — | — | |
| FreeLBModel=BERT2025.07 | 93 | 29 | — | — | — | — | — | |
| TA-VATModel=BERT2025.07 | 93 | 28 | — | — | — | — | — | |
| Attention (SMaT)Number of student training samples=2000, Base model=ELECTRA small2022.04 | 92.84 | — | — | — | — | — | — | |
| Attention (SMaT)Number of student training samples=1000, Base model=ELECTRA small2022.04 | 92.56 | — | — | — | — | — | — | |
| baseline (BERT)Model=BERT2025.07 | 92.1 | 10.3 | — | — | — | — | — | |
| GBMModel=BERT2025.07 | 92.1 | 90.6 | — | — | — | — | — | |
| InfoBERTModel=BERT2025.07 | 92 | 19 | — | — | — | — | — | |
| MixADAModel=BERT2025.07 | 91.9 | 19 | — | — | — | — | — | |
| Text-CRSModel=BERT2025.07 | 91.5 | 84.4 | — | — | — | — | — | |
| Byte-level T5 BaseTokenization=Byte, Parameters=200M2021.06 | 91.5 | — | — | — | — | — | — | |
| CHARFORMER BaseTokenization=Character, Parameters=203M2021.06 | 91.5 | — | — | — | — | — | — | |
| Attention (SMaT)Number of student training samples=500, Base model=ELECTRA small2022.04 | 91.48 | — | — | — | — | — | — | |
| Attention (last layer)Number of student training samples=2000, Base model=ELECTRA small2022.04 | 91.47 | — | — | — | — | — | — | |
| Drop Clause Tsetlin Machinemode=DC (Drop Clause)2021.05 | 91.27 | — | — | — | — | — | — | |
| Byte-level T5+LASC BaseTokenization=Byte, Architecture=LASC, Parameters=205M2021.06 | 91.1 | — | — | — | — | — | — | |
| DNEModel=BERT2025.07 | 90.4 | 28 | — | — | — | — | — | |
| GBMArchitecture=CNN2025.07 | 90.2 | — | 76.3 | 76.6 | 84.3 | — | — | |
| Attention (all layers)Number of student training samples=2000, Base model=ELECTRA small2022.04 | 90.08 | — | — | — | — | — | — | |
| StandardArchitecture=CNN2025.07 | 89.7 | — | 0.6 | 2.6 | 1.4 | — | — | |
| GBMArchitecture=BiLSTM2025.07 | 89.6 | — | 76.8 | 77.8 | 84.3 | — | — | |
| HAN2022.06 | 89.6 | — | — | — | — | 89.4 | 88.2 | |
| StandardArchitecture=BiLSTM2025.07 | 89.1 | — | 0.2 | 1.6 | 0.3 | — | — | |
| BiLSTM2021.05 | 88.9 | — | — | — | — | — | — | |
| Transformer-1L (Direct)Model=Transformer-1L, #Params=377,858, Training Protocol=Direct2026.04 | 88.53 | — | — | — | — | — | — | |
| CNN2021.05 | 87.9 | — | — | — | — | — | — | |
| ASCCModel=BERT2025.07 | 87.8 | 19.4 | — | — | — | — | — | |
| SEMArchitecture=CNN2025.07 | 87.6 | — | 62.2 | 63.5 | 61.5 | — | — | |
| SEMArchitecture=BiLSTM2025.07 | 86.8 | — | 61.9 | 63.7 | 62.2 | — | — | |
| Transformer-1L (UHN)Model=Transformer-1L, #Params=612,117, Training Protocol=UHN2026.04 | 86.38 | — | — | — | — | — | — | |
| Attention (all layers)Number of student training samples=1000, Base model=ELECTRA small2022.04 | 85.72 | — | — | — | — | — | — | |
| ATFLArchitecture=BiLSTM2025.07 | 85.1 | — | 72.2 | 75.5 | 74 | — | — | |
| ATFLArchitecture=CNN2025.07 | 85 | — | 63.6 | 66.8 | 64.7 | — | — | |
| No ExplainerNumber of student training samples=2000, Base model=ELECTRA small2022.04 | 84.84 | — | — | — | — | — | — | |
| Gradient x InputNumber of student training samples=500, Base model=ELECTRA small2022.04 | 84.83 | — | — | — | — | — | — | |
| ASCCArchitecture=CNN2025.07 | 84.8 | — | 74 | 75.5 | 74.5 | — | — | |
| Gradient L2Number of student training samples=2000, Base model=ELECTRA small2022.04 | 84.78 | — | — | — | — | — | — | |
| ASCCArchitecture=BiLSTM2025.07 | 84.3 | — | 74.2 | 76.8 | 75.5 | — | — | |
| RIFTModel=RoBERTa-base2021.12 | 84.2 | — | — | — | — | — | — | |
| Integrated GradientsNumber of student training samples=2000, Base model=ELECTRA small2022.04 | 84.2 | — | — | — | — | — | — | |
| Gradient x InputNumber of student training samples=2000, Base model=ELECTRA small2022.04 | 83.84 | — | — | — | — | — | — | |
| No ExplainerNumber of student training samples=1000, Base model=ELECTRA small2022.04 | 83.44 | — | — | — | — | — | — | |
| Attention (last layer)Number of student training samples=1000, Base model=ELECTRA small2022.04 | 83.15 | — | — | — | — | — | — | |
| Attention (all layers)Number of student training samples=500, Base model=ELECTRA small2022.04 | 83 | — | — | — | — | — | — | |
| Integrated GradientsNumber of student training samples=500, Base model=ELECTRA small2022.04 | 82.99 | — | — | — | — | — | — | |
| Gradient L2Number of student training samples=1000, Base model=ELECTRA small2022.04 | 82.98 | — | — | — | — | — | — | |
| Integrated GradientsNumber of student training samples=1000, Base model=ELECTRA small2022.04 | 81.79 | — | — | — | — | — | — | |
| No ExplainerNumber of student training samples=500, Base model=ELECTRA small2022.04 | 81.72 | — | — | — | — | — | — | |
| IBPArchitecture=CNN2025.07 | 81.7 | — | 75.9 | 76 | 75.9 | — | — | |
| Gradient L2Number of student training samples=500, Base model=ELECTRA small2022.04 | 81.66 | — | — | — | — | — | — | |
| Gradient x InputNumber of student training samples=1000, Base model=ELECTRA small2022.04 | 81.15 | — | — | — | — | — | — | |
| Attention (last layer)Number of student training samples=500, Base model=ELECTRA small2022.04 | 80.91 | — | — | — | — | — | — | |
| Adv-PTWDModel=RoBERTa-base2021.12 | 80.7 | — | — | — | — | — | — | |
| Adv-BaseModel=RoBERTa-base2021.12 | 80.1 | — | — | — | — | — | — | |
| Adv-MixoutModel=RoBERTa-base2021.12 | 79 | — | — | — | — | — | — | |
| RIFTModel=BERT-base-uncased2021.12 | 78.3 | — | — | — | — | — | — | |
| Adv-MixoutModel=BERT-base-uncased2021.12 | 77.8 | — | — | — | — | — | — | |
| IBPArchitecture=BiLSTM2025.07 | 77.6 | — | 67.5 | 67.8 | 67.6 | — | — | |
| Adv-PTWDModel=BERT-base-uncased2021.12 | 76.6 | — | — | — | — | — | — | |
| SVM2022.06 | 74.8 | — | — | — | — | 74.4 | 73.3 | |
| Adv-BaseModel=BERT-base-uncased2021.12 | 74.6 | — | — | — | — | — | — | |
| Standard DR-AGGaggregation=hierarchical2018.06 | 45.1 | — | — | — | — | — | — | |
| Reverse DR-AGGaggregation=hierarchical2018.06 | 44.5 | — | — | — | — | — | — | |
| UPNN(full)2018.06 | 43.5 | — | — | — | — | — | — | |
| Self-attentionaggregation=hierarchical2018.06 | 43.3 | — | — | — | — | — | — | |
| Cached LSTM2018.06 | 42.1 | — | — | — | — | — | — | |
| Max pooling2018.06 | 41.1 | — | — | — | — | — | — | |
| UPNN(np UP)2018.06 | 40.5 | — | — | — | — | — | — | |
| RNTN+Recurrent2018.06 | 40 | — | — | — | — | — | — | |
| Average pooling2018.06 | 39.1 | — | — | — | — | — | — | |
| ADAMATCHNumber of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 95.2 | — | |
| ADAMATCHNumber of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 94.94 | — | |
| DASHNumber of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 93.34 | — | |
| DASHNumber of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 93.3 | — | |
| FIXMATCHNumber of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 95.26 | — | |
| FIXMATCHNumber of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 94.28 | — | |
| FLEXMATCHNumber of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 95.22 | — | |
| FLEXMATCHNumber of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 94.84 | — | |
| Prompt-based FT (hard)Number of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 86.78 | — | |
| Prompt-based FT (hard)Number of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 89.52 | — | |
| Prompt-based FT (hard)Number of labeled samples=full, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 95.6 | — | |
| Prompt-based FT (hard) + PCPNumber of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 92.49 | — | |
| Prompt-based FT (hard) + PCPNumber of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 94.24 | — | |
| Prompt-based FT (soft)Number of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 88.14 | — | |
| Prompt-based FT (soft)Number of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 90.8 | — | |
| Prompt-based FT (soft)Number of labeled samples=full, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 95.5 | — | |
| Prompt-based FT (soft) + PCPNumber of labeled samples=20, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 93.53 | — | |
| Prompt-based FT (soft) + PCPNumber of labeled samples=100, Backbone=RoBERTa-Large2023.05 | — | — | — | — | — | 94.36 | — |