Sentiment Classification on SST-2
95.99AccuracyRoBERTa Large
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RoBERTa LargeAdded Params (M)=355, Extra LM call=true2026.01 | 95.99 | — | |
| SentriLlama 3.2 (3B) InstructAdded Params (M)=0.003–1.2, Extra LM call=true2026.01 | 95.94 | — | |
| Multi-head self-attnAdded Params (M)=35–35.5, Extra LM call=false2026.01 | 95.39 | — | |
| VanillaModel=DeBERTa2022.10 | 95.07 | — | |
| VanillaModel=FastLCF2022.10 | 95.07 | — | |
| RoBERTa (Gao et al., 2021)# Params=1.0x, Evaluation Protocol=Full fine-tuning2022.12 | 95 | — | |
| Scoring attentionAdded Params (M)=0.10–0.11, Extra LM call=false2026.01 | 94.42 | — | |
| KiteBackbone=Llama 3.2–3B2025.09 | 94.28 | — | |
| OriginalBackbone=BERT-large-uncased2026.02 | 94 | 94 | |
| PruningBackbone=BERT-large-uncased2026.02 | 94 | 94 | |
| KiteBackbone=Qwen 2.5–1.5B2025.09 | 93.35 | — | |
| GRZOBackbone=RoBERTa-large (350M), k-shot setting=512, Optimization Protocol=Zeroth-Order, Training Steps=20k, Batch Size=16, Precision=FP162026.06 | 93.3 | — | |
| EPR + IDAICLPLM=GPT-Neo, m=122024.06 | 93.2 | — | |
| MULI (logits, Llama-3.2-3B)Added Params (M)=0.13–0.77, Extra LM call=false2026.01 | 93.19 | — | |
| BERT_LARGEModel Variant=LARGE2019.10 | 93.1 | — | |
| Llama 3.2 (3B) Chain-of-ThoughtAdded Params (M)=0, Extra LM call=true2026.01 | 93.06 | — | |
| FZOOBackbone=RoBERTa-large (350M), k-shot setting=512, Optimization Protocol=Zeroth-Order, Training Steps=20k, Batch Size=16, Precision=FP162026.06 | 93 | — | |
| MeZOBackbone=RoBERTa-large (350M), k-shot setting=512, Optimization Protocol=Zeroth-Order, Training Steps=20k, Batch Size=16, Precision=FP162026.06 | 92.8 | — | |
| DenseBackbone=Llama 3.2–3B2025.09 | 92.55 | — | |
| BOOSTAUGModel=BERT, Base Augmentation=EDA2022.10 | 92.33 | — | |
| BERT+SCMModel type=Latent semantic tree models, Backbone=BERT2023.08 | 92.31 | — | |
| Direct poolingAdded Params (M)=0.003–0.018, Extra LM call=false2026.01 | 92.29 | — | |
| BERT (2019)Model type=Sequential models2023.08 | 92.25 | — | |
| MetaICL + IDAICLPLM=GPT-Neo, m=122024.06 | 92.1 | — | |
| ZO-MuonBackbone=OPT-1.3B, Evaluation Protocol=Fine-tuning, Iterations=20,000, Optimization Mode=Tuned2026.06 | 92.1 | — | |
| OriginalBackbone=BERT-base-uncased2026.02 | 92 | 93 | |
| Vanilla IPABackbone=RoBERTa-large2026.03 | 91.9 | — | |
| FT(FO)Backbone=RoBERTa-large (350M), k-shot setting=512, Optimization Protocol=Fine-Tuning (First-Order), Training Steps=20k, Batch Size=16, Precision=FP162026.06 | 91.9 | — | |
| CEILBackbone=Llama 3.2–3B2025.09 | 91.86 | — | |
| BM25Backbone=Llama 3.2–3B2025.09 | 91.63 | — | |
| Channel ICL + IDAICLPLM=GPT-Neo, m=122024.06 | 91.5 | — | |
| Coordinate LowRank-LRBackbone=RoBERTa-large2026.03 | 91.3 | — | |
| LP(FO)Backbone=RoBERTa-large (350M), k-shot setting=512, Optimization Protocol=Linear Probing (First-Order), Training Steps=20k, Batch Size=16, Precision=FP162026.06 | 91.3 | — | |
| BERT_BASEModel Variant=BASE2019.10 | 91.2 | — | |
| Channel ICL + IDAICLPLM=GPT-2 1.5B, m=122024.06 | 91.2 | — | |
| ZO-AdaMMBackbone=OPT-1.3B, Evaluation Protocol=Fine-tuning, Iterations=20,000, Optimization Mode=Tuned2026.06 | 91.2 | — | |
| OriginalBackbone=BERT-large-cased2026.02 | 91 | 91 | |
| ZO-SignSGDBackbone=OPT-1.3B, Evaluation Protocol=Fine-tuning, Iterations=20,000, Optimization Mode=Tuned2026.06 | 91 | — | |
| VanillaModel=BERT2022.10 | 90.88 | — | |
| AdaMuGEDBackbone=OPT-1.3B, Evaluation Protocol=Fine-tuning, Iterations=20,000, Optimization Mode=Parameter-free2026.06 | 90.8 | — | |
| Hard-Routed MoR-LoRABackbone=LLaMA-8B2026.06 | 90.71 | — | |
| Channel ICL + IDAICLPLM=GPT-2 0.8B, m=122024.06 | 90.5 | — | |
| EPR + IDAICLPLM=GPT-2 1.5B, m=122024.06 | 90.5 | — | |
| DeBERTa V3 LargeAdded Params (M)=418, Extra LM call=true2026.01 | 90.38 | — | |
| AdaNAGEDBackbone=OPT-1.3B, Evaluation Protocol=Fine-tuning, Iterations=20,000, Optimization Mode=Parameter-free2026.06 | 90.3 | — | |
| CEILBackbone=Qwen 2.5–1.5B2025.09 | 90.25 | — | |
| Stiefel LowRank-LRBackbone=RoBERTa-large2026.03 | 90.2 | — | |
| BM25Backbone=Qwen 2.5–1.5B2025.09 | 90.14 | — | |
| EPR + IDAICLPLM=GPT-2 0.8B, m=122024.06 | 90.1 | — | |
| IDAICLPLM=GPT-2 1.5B, m=122024.06 | 90 | — | |
| PruningBackbone=BERT-base-uncased2026.02 | 90 | 90 | |
| PruningBackbone=BERT-large-cased2026.02 | 90 | 90 | |
| RandomBackbone=Llama 3.2–3B2025.09 | 89.84 | — | |
| MetaICL + IDAICLPLM=GPT-2 1.5B, m=122024.06 | 89.6 | — | |
| FoTBackbone=RoBERTa_LARGE, Samples per class=16, Pre-trained prompt=false2025.06 | 89.56 | — | |
| IDAICLPLM=GPT-2 1.5B, m=82024.06 | 89.5 | — | |
| MVCNN2016.03 | 89.4 | — | |
| CNN-Rule-qNetwork role=teacher network, Rule type=but-rule2016.03 | 89.3 | — | |
| MetaICL + IDAICLPLM=GPT-2 0.8B, m=122024.06 | 89.3 | — | |
| OriginalBackbone=BERT-base-cased2026.02 | 89 | 90 | |
| DenseBackbone=Qwen 2.5–1.5B2025.09 | 88.99 | — | |
| CNN-Rule-pNetwork role=student network, Rule type=but-rule2016.03 | 88.8 | — | |
| Hard-Routed MoR-LoRABackbone=LLaMA-3B2026.06 | 88.76 | — | |
| IDAICLPLM=GPT-2 0.8B, m=122024.06 | 88.5 | — | |
| MGNC-CNN2016.03 | 88.4 | — | |
| EPRPLM=GPT-Neo, m=122024.06 | 88.2 | — | |
| SecP-TuningBackbone=RoBERTa_LARGE, Samples per class=162025.06 | 88.11 | — | |
| CNN-multichannelword vectors=pre-trained (word2vec), channels=22014.08 | 88.1 | — | |
| CNN-multichannel2015.02 | 88.1 | — | |
| MultichannelGroup=CNNs, Direct transfer from 5-class network=false2015.04 | 88.1 | — | |
| CNN-multichannel2016.03 | 88.1 | — | |
| BILSTM+SCMModel type=Latent semantic tree models, Backbone=BiLSTM2023.08 | 88.03 | — | |
| Constituency Tree-LSTMword embeddings=Glove vectors, tuned2015.02 | 88 | — | |
| Tree LSTM (variant 3)Group=RNNs, Direct transfer from 5-class network=false2015.04 | 88 | — | |
| TreeLSTM (2015)Model type=Untagged tree (by external parser) models2023.08 | 88 | — | |
| IDAICLPLM=GPT-2 0.8B, m=82024.06 | 88 | — | |
| NoiseBackbone=BERT-large-cased2026.02 | 88 | 88 | |
| Gaussian LowRank-LRBackbone=RoBERTa-large2026.03 | 88 | — | |
| d-TBCNNGroup=TBCNNs, Direct transfer from 5-class network=true2015.04 | 87.9 | — | |
| Paragraph-Vec2014.08 | 87.8 | — | |
| Paragraph-Vec2015.02 | 87.8 | — | |
| Paragraph vectorGroup=Vector, Direct transfer from 5-class network=false2015.04 | 87.8 | — | |
| Paragraph vectors2019.10 | 87.8 | — | |
| Paragraph-Vec2016.03 | 87.8 | — | |
| Liu et al., 2017aModel type=Untagged tree (by external parser) models2023.08 | 87.8 | — | |
| Liu et al., 2017bModel type=Untagged tree (by external parser) models2023.08 | 87.8 | — | |
| MetaICLPLM=GPT-Neo, m=122024.06 | 87.8 | — | |
| BILSTM (1997)Model type=Sequential models2023.08 | 87.52 | — | |
| Bidirectional LSTM2015.02 | 87.5 | — | |
| Constituency Tree-LSTMword embeddings=Glove vectors, fixed2015.02 | 87.5 | — | |
| BILSTM2019.10 | 87.5 | — | |
| IDAICLPLM=GPT-2 1.5B, m=42024.06 | 87.4 | — | |
| CNN-non-staticword vectors=fine-tuned pre-trained (word2vec)2014.08 | 87.2 | — | |
| CNN-non-static2015.02 | 87.2 | — | |
| 2-layer Bidirectional LSTM2015.02 | 87.2 | — | |
| Non-staticGroup=CNNs, Direct transfer from 5-class network=false2015.04 | 87.2 | — | |
| CNN2019.10 | 87.2 | — | |
| CNNModel variant=non-static2016.03 | 87.2 | — | |
| NPM# Params=1.0x, Evaluation Protocol=Zero-shot, nonparametric=true2022.12 | 87.2 | — | |
| Tree LSTM (variant 2)Group=RNNs, Direct transfer from 5-class network=false2015.04 | 86.9 | — |