Emotion Classification on Emotion (Accuracy)
87.68AccuracyMulti-head self-attn
Evaluation Results
| Method | Links | |
|---|---|---|
| Multi-head self-attnAdded Params (M)=35–35.5, Extra LM call=false2026.01 | 87.68 | |
| DeBERTa V3 LargeAdded Params (M)=418, Extra LM call=true2026.01 | 87.65 | |
| Scoring attentionAdded Params (M)=0.10–0.11, Extra LM call=false2026.01 | 84.58 | |
| RoBERTa LargeAdded Params (M)=355, Extra LM call=true2026.01 | 84.16 | |
| SentriLlama 3.2 (3B) InstructAdded Params (M)=0.003–1.2, Extra LM call=true2026.01 | 82.2 | |
| Text OutputModel=Mistral2026.02 | 75.2 | |
| Direct poolingAdded Params (M)=0.003–0.018, Extra LM call=false2026.01 | 69.18 | |
| Text OutputModel=LLaMA3-8B2026.02 | 68.4 | |
| MULI (logits, Llama-3.2-3B)Added Params (M)=0.13–0.77, Extra LM call=false2026.01 | 64.05 | |
| Text OutputModel=Llama3.2-3B2026.02 | 62.2 | |
| MIPICBackbone=BERT, Dimension=7682026.04 | 58.65 | |
| Llama 3.2 (3B) Chain-of-ThoughtAdded Params (M)=0, Extra LM call=true2026.01 | 56.05 | |
| Unsupervised ProbeModel=Llama3.2-3B2026.02 | 54.59 | |
| Unsupervised ProbeModel=LLaMA3-8B2026.02 | 53.52 | |
| Zero-Shot ProbeModel=LLaMA3-8B2026.02 | 52.43 | |
| Unsupervised ProbeModel=Mistral2026.02 | 51.34 | |
| Zero-Shot ProbeModel=Mistral2026.02 | 50.15 | |
| Text OutputModel=GPT2-Small2026.02 | 49.8 | |
| Zero-Shot ProbeModel=Llama3.2-3B2026.02 | 46.73 | |
| Llama 3.2 (3B) Zero-shotAdded Params (M)=0, Extra LM call=true2026.01 | 44.55 | |
| SAE ProbeModel=Mistral2026.02 | 43.64 | |
| SAE ProbeModel=LLaMA3-8B2026.02 | 38.32 | |
| SAE ProbeModel=Llama3.2-3B2026.02 | 35.76 | |
| Llama 3.2 (3B) Few-shotAdded Params (M)=0, Extra LM call=true2026.01 | 33.4 | |
| Unsupervised ProbeModel=GPT2-Small2026.02 | 21.32 | |
| SAE ProbeModel=GPT2-Small2026.02 | 17.69 | |
| Zero-Shot ProbeModel=GPT2-Small2026.02 | 17.37 |