Text Classification on SST-5
62.31AccuracyLS-LLaMA-2-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| LS-LLaMA-2-7BModel Size=7B2023.10 | 62.31 | |
| LS-LLaMA-2-13BModel Size=13B2023.10 | 62.17 | |
| LS-unLLaMA-2-7BModel Size=7B2023.10 | 60.5 | |
| Heinsen RoutingBackbone=RoBERTa-large, Transformer Status=Frozen, Routing Iterations (n_iters)=22022.11 | 59.8 | |
| RoBERTa-LargeModel Architecture=Discriminant baseline2023.10 | 59.64 | |
| RoBERTa-BaseModel Architecture=Discriminant baseline2023.10 | 58.46 | |
| PRLDataset-free=false2026.02 | 56.21 | |
| PRLBackbone=Qwen2.5-7B-Instruct, Prompt Selection=True2025.05 | 56.21 | |
| BERT-LargeModel Architecture=Discriminant baseline2023.10 | 55.79 | |
| AGNModel Architecture=Discriminant baseline2023.10 | 55.72 | |
| DEDataset-free=false2026.02 | 55.25 | |
| DEBackbone=Qwen2.5-7B-Instruct2025.05 | 55.25 | |
| GPS-JDataset-free=true2026.02 | 55.16 | |
| GPS-SR-0.1Dataset-free=true2026.02 | 55.14 | |
| BERT-BaseModel Architecture=Discriminant baseline2023.10 | 55.07 | |
| PRLBackbone=Qwen2.5-7B-Instruct, Prompt Selection=False2025.05 | 54.8 | |
| TATRADataset-free=true2026.02 | 54.66 | |
| CCModel=Mistral, k-shot=8, Seeds=52025.05 | 54.22 | |
| DCModel=Mistral, k-shot=8, Seeds=52025.05 | 54.06 | |
| GRACEDataset-free=false2026.02 | 53.96 | |
| GRACEBackbone=Qwen2.5-7B-Instruct2025.05 | 53.96 | |
| APODataset-free=false2026.02 | 53.94 | |
| APOBackbone=Qwen2.5-7B-Instruct2025.05 | 53.94 | |
| GADataset-free=false2026.02 | 53.76 | |
| GABackbone=Qwen2.5-7B-Instruct2025.05 | 53.76 | |
| PIAST (E)Dataset-free=false2026.02 | 53.33 | |
| PIASTDataset-free=false2026.02 | 53.27 | |
| ICLBackbone=Qwen-3-8B2026.05 | 53.08 | |
| LS-unLLaMA-2-13BModel Size=13B2023.10 | 52.99 | |
| MIDataset-free=true2026.02 | 52.31 | |
| MIBackbone=Qwen2.5-7B-Instruct2025.05 | 52.31 | |
| PromptWizardBackbone=Qwen2.5-7B-Instruct2025.05 | 52.04 | |
| NIDataset-free=true2026.02 | 51.9 | |
| NIBackbone=Qwen2.5-7B-Instruct2025.05 | 51.9 | |
| PromptAgentBackbone=Qwen2.5-7B-Instruct2025.05 | 51.74 | |
| CCModel=Llama, k-shot=8, Seeds=52025.05 | 50.08 | |
| APEDataset-free=false2026.02 | 49.37 | |
| APEBackbone=Qwen2.5-7B-Instruct2025.05 | 49.37 | |
| DCModel=Llama, k-shot=8, Seeds=52025.05 | 48.59 | |
| ICLBackbone=Qwen-2.5-7B2026.05 | 48.56 | |
| SCModel=Mistral, k-shot=8, Seeds=52025.05 | 48.52 | |
| ICLModel=LLaMA-3.1-8B2026.05 | 48.32 | |
| ICLBackbone=LLaMA-3.1-8B2026.05 | 48.32 | |
| Curate-Train-Refinek=8, parameters=110M2026.01 | 47.7 | |
| Curate-Train-Refinek=0, parameters=110M2026.01 | 47 | |
| ICLModel=LLaMA-2-13B2026.05 | 46.52 | |
| ICLBackbone=LLaMA-2-13B2026.05 | 46.52 | |
| Curate-Train-Refinek=2, parameters=110M2026.01 | 46.38 | |
| Curate-Train-Refinek=4, parameters=110M2026.01 | 46.2 | |
| SCModel=Llama, k-shot=8, Seeds=52025.05 | 45.94 | |
| AncSetFitk=8, parameters=110M2026.01 | 45.2 | |
| GliClass 3.0k=0, parameters=151M2026.01 | 43.8 | |
| SCModel=Qwen, k-shot=8, Seeds=52025.05 | 43.52 | |
| AncSetFitk=4, parameters=110M2026.01 | 43.4 | |
| LLaMA-2-7BEvaluation Protocol=instruction-tuning, Model Size=7B2023.10 | 43.35 | |
| ICLBackbone=LLaMA-2-7B2026.05 | 42.88 | |
| LTVModel=LLaMA-2-13B2026.05 | 41.88 | |
| LTVBackbone=LLaMA-2-13B2026.05 | 41.88 | |
| AncSetFitk=2, parameters=110M2026.01 | 40.5 | |
| USMoEBackbone=Transformer-XL(20M), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 40.1 | |
| ADAPET-Basek=8, parameters=117M2026.01 | 39.6 | |
| USMoEBackbone=Transformer-XL(20M), Top-k=1.5, FLOPs=6.6753 x 10^10, Fine-tuning=true2025.03 | 39.6 | |
| LTVBackbone=Qwen-3-8B2026.05 | 39.4 | |
| ECBackbone=Transformer-XL(20M), Routing=Expert Choice (EC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 39.3 | |
| LLaMA-2-7BEvaluation Protocol=zero-shot, Model Size=7B2023.10 | 39.05 | |
| LTVBackbone=LLaMA-2-7B2026.05 | 38.68 | |
| LTVModel=LLaMA-3.1-8B2026.05 | 38.2 | |
| LTVBackbone=LLaMA-3.1-8B2026.05 | 38.2 | |
| LLaMA-2-13BEvaluation Protocol=zero-shot, Model Size=13B2023.10 | 37.01 | |
| State VectorModel=LLaMA-3.1-8B2026.05 | 36.6 | |
| State VectorBackbone=LLaMA-3.1-8B2026.05 | 36.6 | |
| State VectorModel=LLaMA-2-13B2026.05 | 36.08 | |
| State VectorBackbone=LLaMA-2-13B2026.05 | 36.08 | |
| ADAPET-Basek=4, parameters=117M2026.01 | 35.5 | |
| XMoEBackbone=Transformer-XL(20M), Routing=Token Choice (TC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 35.3 | |
| SMoEBackbone=Transformer-XL(20M), Routing=Token Choice (TC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 35.1 | |
| BCModel=Mistral, k-shot=8, Seeds=52025.05 | 34.92 | |
| I2CLBackbone=Qwen-3-8B2026.05 | 34.92 | |
| Function VectorBackbone=Qwen-3-8B2026.05 | 34.88 | |
| Zero-shotBackbone=Qwen-3-8B2026.05 | 34.8 | |
| Task VectorModel=LLaMA-3.1-8B2026.05 | 34.76 | |
| Task VectorBackbone=LLaMA-3.1-8B2026.05 | 34.76 | |
| I2CLBackbone=LLaMA-2-7B2026.05 | 34.72 | |
| SMoE-DRBackbone=Transformer-XL(20M), Routing=Token Choice (TC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 34.4 | |
| StableMoEBackbone=Transformer-XL(20M), Routing=Token Choice (TC), Top-k=2, FLOPs=7.7620 x 10^10, Fine-tuning=true2025.03 | 34.3 | |
| Task VectorBackbone=Qwen-3-8B2026.05 | 34.08 | |
| State VectorBackbone=Qwen-3-8B2026.05 | 33.92 | |
| State VectorBackbone=LLaMA-2-7B2026.05 | 33.68 | |
| Task VectorModel=LLaMA-2-13B2026.05 | 33.64 | |
| Task VectorBackbone=LLaMA-2-13B2026.05 | 33.64 | |
| ADAPET-Basek=2, parameters=117M2026.01 | 32.9 | |
| I2CLModel=LLaMA-3.1-8B2026.05 | 32.48 | |
| I2CLBackbone=LLaMA-3.1-8B2026.05 | 32.48 | |
| Task VectorBackbone=LLaMA-2-7B2026.05 | 32.24 | |
| BCModel=Llama, k-shot=8, Seeds=52025.05 | 31.48 | |
| LTVBackbone=Qwen-2.5-7B2026.05 | 31.32 | |
| State VectorBackbone=Qwen-2.5-7B2026.05 | 30.6 | |
| Zero-shotBackbone=LLaMA-2-7B2026.05 | 28.4 | |
| Function VectorBackbone=LLaMA-2-7B2026.05 | 27.84 | |
| Function VectorModel=LLaMA-3.1-8B2026.05 | 26.2 |