General Language Understanding on GLUE v1 (test dev)
87.86MNLIBOMF (Ours)
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BOMF (Ours)Backbone=RoBERTa-base2024.11 | 87.86 | — | 93.5 | 95.54 | — | — | 81.4 | — | — | 93.9 | 88.68 | |
| BOMFBackbone=RoBERTa-base, Tuning Strategy=Freeze2024.11 | 87.86 | — | 93.5 | 95.54 | — | — | 81.4 | — | 90.15 | 93.9 | 88.68 | |
| Greedy SWABackbone=RoBERTa-base, Tuning Strategy=Freeze2024.11 | 87.84 | — | 93.3 | 95.2 | — | — | 80.01 | — | 89.73 | 93.38 | 88.67 | |
| Learned SWABackbone=RoBERTa-base, Tuning Strategy=Freeze2024.11 | 87.55 | — | 93.03 | 95.2 | — | — | 78.79 | — | 89.43 | 93.56 | 88.43 | |
| Grid Search Inner BOBackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.54 | — | 92.79 | 95.31 | — | — | 79.66 | — | 89.33 | 92.48 | 88.24 | |
| BOMFT (Ours)Backbone=RoBERTa-base2024.11 | 87.51 | — | 94.83 | 95.65 | — | — | 81.75 | — | — | 93.37 | 88.66 | |
| BOMFBackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.51 | — | 94.83 | 95.65 | — | — | 81.75 | — | 90.3 | 93.37 | 88.66 | |
| HPBO (Full)Backbone=RoBERTa-base2024.11 | 87.46 | — | 93.01 | 95.11 | — | — | 78.57 | — | — | 92.78 | 88.58 | |
| HPBOBackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.46 | — | 93.01 | 95.11 | — | — | 78.57 | — | 89.25 | 92.78 | 88.58 | |
| Greedy SWABackbone=RoBERTa-base2024.11 | 87.45 | — | 93.16 | 95.54 | — | — | 80.7 | — | — | 92.83 | 88.64 | |
| Greedy SWABackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.45 | — | 93.16 | 95.54 | — | — | 80.7 | — | 89.72 | 92.83 | 88.64 | |
| HPBOBackbone=RoBERTa-base, Tuning Strategy=Freeze2024.11 | 87.45 | — | 92.71 | 94.41 | — | — | 78.49 | — | 88.97 | 92.72 | 88.04 | |
| SWABackbone=RoBERTa-base, Tuning Strategy=Freeze2024.11 | 87.44 | — | 93.21 | 94.75 | — | — | 76.7 | — | 88.7 | 91.73 | 88.35 | |
| TWABackbone=RoBERTa-base, Tuning Strategy=Freeze2024.11 | 87.44 | — | 92.86 | 94.87 | — | — | 78.29 | — | 89.03 | 92.16 | 88.59 | |
| OTFusionBackbone=RoBERTa-base2024.11 | 87.43 | — | 92.22 | 94.27 | — | — | 77.08 | — | — | 92.82 | 88.34 | |
| TWABackbone=RoBERTa-base2024.11 | 87.42 | — | 93 | 95.54 | — | — | 81.23 | — | — | 91.58 | 87.85 | |
| TWABackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.42 | — | 93 | 95.54 | — | — | 81.23 | — | 89.44 | 91.58 | 87.85 | |
| Grid Fine-TuneBackbone=RoBERTa-base2024.11 | 87.41 | — | 92.62 | 94.87 | — | — | 77.78 | — | — | 92.39 | 88.16 | |
| SWABackbone=RoBERTa-base2024.11 | 87.41 | — | 92.81 | 95.42 | — | — | 78.62 | — | — | 92.24 | 88.49 | |
| Learned SWABackbone=RoBERTa-base2024.11 | 87.41 | — | 92.94 | 95.31 | — | — | 81.4 | — | — | 92.81 | 88.38 | |
| Grid Fine-tuneBackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.41 | — | 92.62 | 94.87 | — | — | 77.78 | — | 88.93 | 92.39 | 88.16 | |
| SWABackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.41 | — | 92.81 | 95.42 | — | — | 78.62 | — | 89.17 | 92.24 | 88.49 | |
| Learned SWABackbone=RoBERTa-base, Tuning Strategy=Full2024.11 | 87.41 | — | 92.94 | 95.31 | — | — | 81.4 | — | 89.71 | 92.81 | 88.38 | |
| SCALEARN++Backbone=RoBERTa-base, Learning Paradigm=Two-stage MTL2023.10 | 87.06 | 90.04 | 92.03 | 94.15 | 90.62 | 88.21 | 80.87 | 59.82 | 85.35 | — | — | |
| SCALEARNUNIFORM++Backbone=RoBERTa-base, Learning Paradigm=Two-stage MTL2023.10 | 86.98 | 90.38 | 92.53 | 94.11 | 90.18 | 87.43 | 80.04 | 59.45 | 85.14 | — | — | |
| SCALEARNBackbone=RoBERTa-base, Learning Paradigm=Two-stage MTL2023.10 | 86.97 | 90.32 | 92.51 | 93.88 | 90.96 | 87.75 | 82.06 | 58.47 | 85.36 | — | — | |
| SCALEARNUNIFORMBackbone=RoBERTa-base, Learning Paradigm=Two-stage MTL2023.10 | 86.93 | 90.38 | 92.53 | 93.58 | 90.08 | 87.57 | 80.07 | 59.04 | 85.02 | — | — | |
| ADAPTERFUSIONBackbone=RoBERTa-base, Learning Paradigm=Two-stage MTL2023.10 | 86.82 | 90.23 | 92.48 | 93.23 | 90.37 | 88.41 | 79.49 | 59.04 | 85.01 | — | — | |
| FINETUNEBackbone=RoBERTa-base, Learning Paradigm=STL2023.10 | 86.61 | 90.32 | 91.78 | 93.33 | 90.53 | 86.94 | 73.47 | 58.46 | 83.93 | — | — | |
| LORABackbone=RoBERTa-base, Learning Paradigm=STL2023.10 | 86.52 | 89.86 | 92.25 | 94.19 | 90.66 | 87.03 | 70.4 | 57.55 | 83.56 | — | — | |
| ADAPTERBackbone=RoBERTa-base, Learning Paradigm=STL2023.10 | 86.5 | 90.18 | 92.25 | 93.65 | 90.23 | 86.64 | 72.89 | 58.28 | 83.83 | — | — | |
| HYPERFORMER++Backbone=RoBERTa-base, Learning Paradigm=Joint MTL2023.10 | 86.38 | 88.81 | 91.99 | 93.27 | 90.8 | 87.83 | 83.75 | 54.05 | 84.61 | — | — | |
| PROPETLBackbone=RoBERTa-base, Learning Paradigm=STL2023.10 | 86.19 | 88.88 | 92.05 | 93.81 | 90.03 | 85.93 | 74.19 | 59.29 | 83.8 | — | — | |
| HYPERFORMERBackbone=RoBERTa-base, Learning Paradigm=Joint MTL2023.10 | 86.08 | 89.13 | 91.81 | 93.16 | 90.63 | 87.01 | 82.79 | 57.3 | 84.74 | — | — | |
| ADAPTER-MBackbone=RoBERTa-base, Learning Paradigm=Joint MTL2023.10 | 86.03 | 89.69 | 91.58 | 93.35 | 88.71 | 86.76 | 80.26 | 51.79 | 83.52 | — | — | |
| COMPACTER++Backbone=RoBERTa-base, Learning Paradigm=STL2023.10 | 85.62 | 88.84 | 91.79 | 93.58 | 89.67 | 87.21 | 72.02 | 58.49 | 83.4 | — | — | |
| PROPETL-MBackbone=RoBERTa-base, Learning Paradigm=Joint MTL2023.10 | 85.23 | 87.82 | 91.37 | 93.88 | 90.27 | 86.36 | 78.58 | 54.71 | 83.53 | — | — | |
| FINETUNE-MBackbone=RoBERTa-base, Learning Paradigm=Joint MTL2023.10 | 84.95 | 89.76 | 90.91 | 92.58 | 86.14 | 83.42 | 80.99 | 49.12 | 82.23 | — | — | |
| (IA)3Backbone=RoBERTa-base, Learning Paradigm=STL2023.10 | 83.78 | 88.37 | 90.57 | 93.35 | 89.93 | 87.11 | 72.56 | 56.57 | 82.78 | — | — | |
| ADAPTERSOUPBackbone=RoBERTa-base, Learning Paradigm=Two-stage MTL2023.10 | 63.47 | 81.63 | 78 | 90.75 | 80.17 | 75 | 62.09 | 41.06 | 71.52 | — | — |