Text Classification on IMDB
96.2AccuracyHeinsen Routing
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Heinsen RoutingBackbone=RoBERTa-large, Transformer Status=Frozen, Routing Iterations (n_iters)=2, Input Sequence Chunking=Enabled (up to 7 chunks)2022.11 | 96.2 | — | — | — | |
| SPINBackbone=LLaMA2-13B2023.11 | 96.06 | — | 1.6 | — | |
| RoBERTa_BASE + UniDropvariant=BASE, regularization=UniDrop2021.04 | 96 | — | — | — | |
| SPINBackbone=LLaMA2-7B2023.11 | 95.76 | — | 1.83 | — | |
| RoBERTa_BASEvariant=BASE2021.04 | 95.7 | — | — | — | |
| ULMFiT2021.04 | 95.4 | — | — | — | |
| TWSSenti2026.02 | 95 | — | — | — | |
| BERT_BASEvariant=BASE2021.04 | 94.6 | — | — | — | |
| BaseBackbone=LLaMA2-13B2023.11 | 94.55 | — | — | — | |
| NPPromptHuman/KB=false, Unlabeled=false2022.12 | 94.2 | 0.2 | — | — | |
| BaseBackbone=LLaMA2-7B2023.11 | 94.04 | — | — | — | |
| KPTHuman/KB=true, Unlabeled=true2022.12 | 94 | — | — | — | |
| BERTType=baseline, Eval Flops=x1.0, Train Speed=x1.02024.05 | 94 | — | — | — | |
| RoBERTaCategory=Black-Box2025.05 | 93.7 | — | — | 93.7 | |
| ECO-ConceptCategory=UNSUP.2025.05 | 93.7 | — | — | 93.7 | |
| TR-BERTType=pruning + mask, Eval Flops=x2.3, Train Speed=x1.02024.05 | 93.6 | — | — | — | |
| PITOMEType=merging, Eval Flops=x1.9, Train Speed=x1.82024.05 | 93.6 | — | — | — | |
| SelfExplainCategory=UNSUP.2025.05 | 93.6 | — | — | 93.6 | |
| IESelection Method=Information Entropy2026.02 | 93.6 | — | — | — | |
| SESelection Method=Shannon Entropy2026.02 | 93.6 | — | — | — | |
| PROTOTEXCategory=UNSUP.2025.05 | 93.5 | — | — | 93.5 | |
| ToMeType=merging, Eval Flops=x1.9, Train Speed=x1.82024.05 | 93.3 | — | — | — | |
| PITOMEType=pruning + mask, Eval Flops=x1.9, Train Speed=x1.82024.05 | 93.2 | — | — | — | |
| GESelection Method=Gini Entropy2026.02 | 93.2 | — | — | — | |
| DistilBERTType=compressed models, Eval Flops=x2.0, Train Speed=x1.92024.05 | 93 | — | — | — | |
| BERT-baseParams=110M, Attention=true, Tokenization=true2026.04 | 93 | — | — | — | |
| ChatGPT w. descriptionsHuman/KB=true, Unlabeled=false2022.12 | 92.7 | — | — | — | |
| ToFuType=merging, Eval Flops=x1.9, Train Speed=x1.82024.05 | 92.6 | — | — | — | |
| PowER-BERTType=pruning + mask, Eval Flops=x2.7, Train Speed=x1.02024.05 | 92.5 | — | — | — | |
| RoBERTa-BiLSTM2026.02 | 92.46 | — | — | — | |
| DCTType=merging, Eval Flops=x1.9, Train Speed=x1.82024.05 | 92.4 | — | — | — | |
| DiffRateType=merging, Eval Flops=x1.9, Train Speed=x1.82024.05 | 92.4 | — | — | — | |
| byte mLSTMd*=40962018.05 | 92.2 | — | — | — | |
| Manual VerbHuman/KB=true, Unlabeled=false2022.12 | 92 | 0.7 | — | — | |
| DistilBERTParams=66M, Attention=true, Tokenization=true2026.04 | 92 | — | — | — | |
| PV2016.05 | 91.7 | — | — | — | |
| DNC-UWWriting Strategy=Uniform Writing2019.01 | 91.4 | — | — | — | |
| Shared-Layer ArchitectureMulti-Task=true, Fine-Tuning=true2016.05 | 91.3 | — | — | — | |
| DNC-CUWWriting Strategy=Cached Uniform Writing2019.01 | 91.3 | — | — | — | |
| Drop Clause Tsetlin MachineDrop Clause Probability=0.752021.05 | 91.27 | — | — | — | |
| Skim-LSTMMode=Skim2019.01 | 91.2 | — | — | — | |
| BERTCategory=Black-Box2025.05 | 91.2 | — | — | 91.2 | |
| Standard LSTMMode=Standard2019.01 | 91.1 | — | — | — | |
| SimPTCHuman/KB=false, Unlabeled=true2022.12 | 91 | 0 | — | — | |
| à la carten=3, d*=48002018.05 | 90.9 | — | — | — | |
| RMDLNumber of RDLs=152018.05 | 90.79 | — | — | — | |
| à la carten=2, d*=32002018.05 | 90.3 | — | — | — | |
| RMDLNumber of RDLs=92018.05 | 90.13 | — | — | — | |
| BonGn=2, d*=V1 + V22018.05 | 90 | — | — | — | |
| RMDLNumber of RDLs=32018.05 | 89.91 | — | — | — | |
| DeBERTa-V3 base + PiFiModel Backbone=DeBERTa-V3-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 89.83 | — | — | 50.14 | |
| BonGn=3, d*=V1 + V2 + V32018.05 | 89.8 | — | — | — | |
| DisCn=2-3, d*=3200-48002018.05 | 89.6 | — | — | — | |
| DeBERTa-V3 baseModel Backbone=DeBERTa-V3-base2025.06 | 89.45 | — | — | 49.51 | |
| ELECTRA base + PiFiModel Backbone=ELECTRA-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 89.4 | — | — | 49.94 | |
| ALBERTType=compressed models, Eval Flops=x1.0, Train Speed=x1.22024.05 | 89.2 | — | — | — | |
| à la carten=1, d*=16002018.05 | 89 | — | — | — | |
| GCPannotation budget=20%2026.02 | 88.94 | — | — | — | |
| DeBERTa base + PiFiModel Backbone=DeBERTa-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 88.85 | — | — | 49.28 | |
| GPT-3 w. descriptionsHuman/KB=true, Unlabeled=false2022.12 | 88.8 | — | — | — | |
| RoBERTa base + PiFiModel Backbone=RoBERTa-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 88.68 | — | — | 48.78 | |
| KATHLEEN-CLEANParams=733K, Attention=false, Tokenization=false2026.04 | 88.6 | — | — | — | |
| RNN2018.05 | 88.59 | — | — | — | |
| DNN2018.05 | 88.55 | — | — | — | |
| USMoEBackbone=Transformer-XL(20M), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 88.5 | — | — | — | |
| SVM(TF-IDF)Representation=TF-IDF2018.05 | 88.45 | — | — | — | |
| ELECTRA baseModel Backbone=ELECTRA-base2025.06 | 88.31 | — | — | 49.74 | |
| BonGn=1, d*=V12018.05 | 88.3 | — | — | — | |
| USMoEBackbone=Transformer-XL(20M), Top-k=1.5, FLOPs=6.6753 x 10^10, Fine-tuning=true2025.03 | 88.3 | — | — | — | |
| ECBackbone=Transformer-XL(20M), Routing=Expert Choice (EC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 88 | — | — | — | |
| DeBERTa baseModel Backbone=DeBERTa-base2025.06 | 87.98 | — | — | 48.82 | |
| SVM2018.05 | 87.97 | — | — | — | |
| CALannotation budget=20%2026.02 | 87.62 | — | — | — | |
| TransEvolve-fullFF-2Feed-forward type=full, Variant=22021.09 | 87.6 | — | — | — | |
| TransEvolve-randomFF-2Feed-forward type=random, Variant=22021.09 | 87.5 | — | — | — | |
| CNN2018.05 | 87.44 | — | — | — | |
| RoBERTa baseModel Backbone=RoBERTa-base2025.06 | 87.36 | — | — | 48.9 | |
| TransEvolve-randomFF-1Feed-forward type=random, Variant=12021.09 | 87.3 | — | — | — | |
| Tsetlin MachineDrop Clause Probability=02021.05 | 87.2 | — | — | — | |
| BERT base + PiFiModel Backbone=BERT-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 87.09 | — | — | 48 | |
| Tok. KathleenParams=11.8M, Attention=false, Tokenization=true2026.04 | 87 | — | — | — | |
| TransEvolve-fullFF-1Feed-forward type=full, Variant=12021.09 | 86.8 | — | — | — | |
| Multi-Null PromptHuman/KB=false, Unlabeled=false2022.12 | 86.6 | 0.6 | — | — | |
| LOTClassHuman/KB=true, Unlabeled=true2022.12 | 86.5 | — | — | — | |
| BADGEannotation budget=20%2026.02 | 85.91 | — | — | — | |
| Sent2Vecn=1-2, d*=7002018.05 | 85.5 | — | — | — | |
| BERT baseModel Backbone=BERT-base2025.06 | 85.1 | — | — | 47.33 | |
| Kathleen FFT+PLGParams=149K, Attention=false, Tokenization=false2026.04 | 85.1 | — | — | — | |
| Synthesizer2021.09 | 84.6 | — | — | — | |
| Regularized BNNorm Position=Post-Norm2022.10 | 84.5 | — | — | — | |
| XGBoostLibrary=sklearn, Parameters=default2021.05 | 84.4 | — | — | — | |
| Regularized BNNorm Position=Pre-Norm2022.10 | 84.4 | — | — | — | |
| SMoEBackbone=Transformer-XL(20M), Routing=Token Choice (TC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 84.4 | — | — | — | |
| ALPSannotation budget=20%2026.02 | 84.26 | — | — | — | |
| LayerNormNorm Position=Post-Norm2022.10 | 84.1 | — | — | — | |
| LayerNormNorm Position=Pre-Norm2022.10 | 84.1 | — | — | — | |
| BatchNormNorm Position=Post-Norm2022.10 | 84 | — | — | — | |
| BatchNormNorm Position=Pre-Norm2022.10 | 84 | — | — | — | |
| StableMoEBackbone=Transformer-XL(20M), Routing=Token Choice (TC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 83.9 | — | — | — | |
| NBOW2016.05 | 83.62 | — | — | — |