Natural Language Processing on 7 NLP Tasks (test)
88.9Average AccuracyFine-tuned
Evaluation Results
| Method | Links | |
|---|---|---|
| Fine-tunedBackbone=T5-Large2025.05 | 88.9 | |
| MultitaskBackbone=T5-Large2025.05 | 88.1 | |
| MultitaskBackbone=T5-Base2025.05 | 83.6 | |
| Fine-tunedBackbone=T5-Base2025.05 | 83.1 | |
| ExpertsModel=T5-L, Data-free=-2026.04 | 82.4 | |
| NPSBackbone=T5-Large2025.05 | 82.1 | |
| REGMEANModel=T5-L, Data-free=false2026.04 | 80.8 | |
| Consensus TIESBackbone=T5-Large2025.05 | 80.5 | |
| Ties-MergingBackbone=T5-Large2025.05 | 80.3 | |
| Task ArithmeticBackbone=T5-Large2025.05 | 80.2 | |
| Consensus TABackbone=T5-Large2025.05 | 80.2 | |
| RegMeanBackbone=T5-Large2025.05 | 79.8 | |
| ACTMATModel=T5-L, Data-free=true2026.04 | 79.8 | |
| ExpertsModel=T5-B, Data-free=-2026.04 | 76 | |
| ACTMATModel=T5-B, Data-free=true2026.04 | 76 | |
| NPSBackbone=T5-Base2025.05 | 75.7 | |
| TSVModel=T5-L, Data-free=true2026.04 | 74.7 | |
| REGMEANModel=T5-B, Data-free=false2026.04 | 74.5 | |
| Ties-MergingBackbone=T5-Base2025.05 | 73.6 | |
| Consensus TIESBackbone=T5-Base2025.05 | 73.4 | |
| Consensus TABackbone=T5-Base2025.05 | 73.1 | |
| Task ArithmeticBackbone=T5-Base2025.05 | 73 | |
| TSVModel=T5-B, Data-free=true2026.04 | 72.9 | |
| RegMeanBackbone=T5-Base2025.05 | 72.7 | |
| TAModel=T5-B, Data-free=false2026.04 | 71.4 | |
| TAModel=T5-L, Data-free=false2026.04 | 69.7 | |
| Fisher MergingBackbone=T5-Large2025.05 | 68.7 | |
| Fisher MergingBackbone=T5-Base2025.05 | 68.3 | |
| ISO-CModel=T5-B, Data-free=true2026.04 | 66.1 | |
| AveragingBackbone=T5-Base2025.05 | 65.3 | |
| AVERAGEModel=T5-B, Data-free=true2026.04 | 64.8 | |
| TAModel=T5-B, Data-free=true2026.04 | 60.5 | |
| TAModel=T5-L, Data-free=true2026.04 | 59.8 | |
| ISO-CModel=T5-L, Data-free=true2026.04 | 57.6 | |
| AveragingBackbone=T5-Large2025.05 | 54.7 | |
| ZeroshotModel=T5-B, Data-free=-2026.04 | 54 | |
| ZeroshotModel=T5-L, Data-free=-2026.04 | 51.3 | |
| AVERAGEModel=T5-L, Data-free=true2026.04 | 50.9 |