Natural Language Inference on SNLI 1.0 (train)
93.1AccuracyGumbel TreeLSTM
Evaluation Results
| Method | Links | |
|---|---|---|
| Gumbel TreeLSTMDimension=600D, Parameters (m)=10.02018.08 | 93.1 | |
| Reinforced self-attention networkDimension=300D, Parameters (m)=3.1, T(s)/epoch=6222018.08 | 92.6 | |
| Directional self-attention networkDimension=300D, Parameters (m)=2.4, T(s)/epoch=5872018.08 | 91.1 | |
| Residual stacked encodersDimension=600D, Parameters (m)=29.02018.08 | 91 | |
| Distance-based self-attention networkDimension=1200D, Parameters (m)=4.7, T(s)/epoch=6932018.08 | 89.6 | |
| Multiple DSADimension=2400D, Parameters (m)=7.0, T(s)/epoch=1982018.08 | 89 | |
| CNN (Dense) with self-attentionDimension=600D, Parameters (m)=2.4, T(s)/epoch=1212018.08 | 88.7 | |
| Single DSADimension=600D, Parameters (m)=2.1, T(s)/epoch=1352018.08 | 87.3 | |
| BiLSTM with self-attentionDimension=600D, Parameters (m)=2.82018.08 | 84.5 |