Natural Language Inference on MNLI-m (dev)
90.6AccuracyDeBERTaV3_base
Evaluation Results
| Method | Links | |
|---|---|---|
| DeBERTaV3_baseLayers=12, Hidden size=768, Heads=12, Vocabulary Size(K)=128, Backbone #Params(M)=862021.11 | 90.6 | |
| ELECTRA_baseLayers=12, Hidden size=768, Heads=12, Vocabulary Size(K)=30, Backbone #Params(M)=862021.11 | 88.8 | |
| DeBERTa_baseLayers=12, Hidden size=768, Heads=12, Vocabulary Size(K)=50, Backbone #Params(M)=1002021.11 | 88.8 | |
| DeBERTaV3_smallLayers=6, Hidden size=768, Heads=12, Vocabulary Size(K)=128, Backbone #Params(M)=442021.11 | 88.2 | |
| DeBERTaV3_xsmallLayers=12, Hidden size=384, Heads=6, Vocabulary Size(K)=128, Backbone #Params(M)=222021.11 | 88.1 | |
| RoBERTa_baseLayers=12, Hidden size=768, Heads=12, Vocabulary Size(K)=50, Backbone #Params(M)=862021.11 | 87.6 | |
| MiniLMv2_smallLayers=6, Hidden size=768, Heads=12, Vocabulary Size(K)=30, Backbone #Params(M)=442021.11 | 87 | |
| MiniLMv2_xsmallLayers=12, Hidden size=384, Heads=6, Vocabulary Size(K)=30, Backbone #Params(M)=222021.11 | 86.9 | |
| XLNet_baseLayers=12, Hidden size=768, Heads=12, Vocabulary Size(K)=32, Backbone #Params(M)=922021.11 | 86.8 | |
| TinyBERT_smallLayers=6, Hidden size=768, Heads=12, Vocabulary Size(K)=30, Backbone #Params(M)=442021.11 | 84.5 | |
| BERT_baseLayers=12, Hidden size=768, Heads=12, Vocabulary Size(K)=30, Backbone #Params(M)=862021.11 | 84.3 | |
| BERT_smallLayers=6, Hidden size=768, Heads=12, Vocabulary Size(K)=30, Backbone #Params(M)=442021.11 | 81.8 |