Visual Dialog on VisDial v1.0 (test-std)
75.13NDCGVD-BERT
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| VD-BERTEnsemble=true, Fine-tuning on dense annotations=true2019.11 | 75.13 | 50 | 38.28 | 60.93 | 77.28 | 6.9 | |
| VD-BERTModel type=Ensemble, Fine-tuning on dense annotations=true2026.05 | 75.13 | 50 | 38.28 | 60.93 | 77.28 | 6.9 | |
| P1_P2Ensemble=true, Fine-tuning on dense annotations=true2019.11 | 74.91 | 49.13 | 36.68 | 62.98 | 78.55 | 7.03 | |
| P1_P2Model type=Ensemble, Fine-tuning on dense annotations=true2026.05 | 74.91 | 49.13 | 36.68 | 62.98 | 78.55 | 7.03 | |
| LTMIEnsemble=true, Fine-tuning on dense annotations=true2019.11 | 74.88 | 52.14 | 38.93 | 66.6 | 80.65 | 6.53 | |
| LTMIModel type=Ensemble, Fine-tuning on dense annotations=true2026.05 | 74.88 | 52.14 | 38.93 | 66.6 | 80.65 | 6.53 | |
| VD-BERTdense labels=true2022.05 | 74.54 | 46.72 | 33.15 | 61.58 | 77.15 | 7.18 | |
| VisDial-BERTdense labels=true2022.05 | 74.47 | 50.74 | 37.95 | 64.13 | 80 | 6.28 | |
| UTCdense labels=true2022.05 | 74.32 | 50.24 | 37.12 | 63.98 | 79.88 | 6.48 | |
| SGL+KTdense labels=true2022.05 | 72.6 | 58.01 | 46.2 | 71.01 | 83.2 | 5.85 | |
| MCAdense labels=true2022.05 | 72.47 | 37.68 | 20.67 | 56.67 | 72.12 | 8.89 | |
| Studentdense labels=true2022.05 | 71.76 | 68.09 | 55.18 | 83.68 | 91.93 | 3.57 | |
| P1+P2dense labels=true2022.05 | 71.6 | 48.58 | 35.98 | 62.08 | 77.23 | 7.48 | |
| LTMIEnsemble=true, Fine-tuning on dense annotations=false2019.11 | 66.53 | 63.19 | 49.18 | 80.45 | 89.75 | 4.14 | |
| LTMIModel type=Ensemble, Fine-tuning on dense annotations=false2026.05 | 66.53 | 63.19 | 49.18 | 80.45 | 89.75 | 4.14 | |
| Studentdense labels=false2022.05 | 64.91 | 68.44 | 55.05 | 85.18 | 93.35 | 3.23 | |
| ReDANEnsemble=true, Fine-tuning on dense annotations=false2019.11 | 64.47 | 53.73 | 42.45 | 64.68 | 75.68 | 6.63 | |
| ReDANModel type=Ensemble, Fine-tuning on dense annotations=false2026.05 | 64.47 | 53.73 | 42.45 | 64.68 | 75.68 | 6.63 | |
| VisDial-BERTdense labels=false2022.05 | 63.87 | 67.5 | 53.85 | 84.68 | 93.25 | 3.32 | |
| ReDANdense labels=false2022.05 | 61.86 | 53.13 | 41.38 | 66.07 | 74.5 | 8.91 | |
| MVANdecoder=discriminative, ensemble=true2020.04 | 60.92 | 66.38 | 53.2 | 82.45 | 91.85 | 3.68 | |
| LTMIModel Configuration=Single-model2026.05 | 60.92 | 60.65 | 47 | 77.03 | 87.75 | 4.9 | |
| VD-BERTdense labels=false2022.05 | 59.96 | 65.44 | 51.63 | 82.23 | 90.68 | 3.9 | |
| MVANdecoder=discriminative, ensemble=false2020.04 | 59.37 | 64.84 | 51.45 | 81.12 | 90.65 | 3.97 | |
| DANensemble=true, ensemble_size=6, attention_heads=1-62019.02 | 59.36 | 64.92 | 51.28 | 81.6 | 90.88 | 3.92 | |
| DANEnsemble=true, Fine-tuning on dense annotations=false2019.11 | 59.36 | 64.92 | 51.28 | 81.6 | 90.88 | 3.92 | |
| DANModel type=Ensemble, Fine-tuning on dense annotations=false2026.05 | 59.36 | 64.92 | 51.28 | 81.6 | 90.88 | 3.92 | |
| LTMIModel Configuration=Single-model, Early stopping on MRR metric=true2026.05 | 59.03 | 64.08 | 50.2 | 80.68 | 90.35 | 4.05 | |
| NMNBackbone=ResNet-152, External Knowledge=true2019.04 | 58.1 | 58.8 | 44.15 | 76.88 | 86.88 | 4.81 | |
| Synergisticensemble=true, ensemble_size=10, image_features=bottom-up attention, source=VisDial Challenge 2018 Leaderboard2019.02 | 57.88 | 63.42 | 49.3 | 80.77 | 90.68 | 3.97 | |
| SynergisticEnsemble=true, Fine-tuning on dense annotations=false2019.11 | 57.88 | 63.42 | 49.3 | 80.77 | 90.68 | 3.97 | |
| SynergisticModel type=Ensemble, Fine-tuning on dense annotations=false2026.05 | 57.88 | 63.42 | 49.3 | 80.77 | 90.68 | 3.97 | |
| DANModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 57.59 | 63.2 | 49.63 | 79.75 | 89.35 | 4.3 | |
| DANdecoder=discriminative, ensemble=false2020.04 | 57.59 | 63.2 | 49.63 | 79.75 | 89.35 | 4.3 | |
| DANdense labels=false2022.05 | 57.59 | 63.2 | 49.63 | 79.75 | 89.35 | 4.3 | |
| DANModel Configuration=Single-model2026.05 | 57.59 | 63.2 | 49.63 | 79.75 | 89.35 | 4.3 | |
| DL-G1model_type=single-step2019.11 | 57.32 | 62.2 | 47.9 | 80.43 | 89.95 | 4.17 | |
| SynergisticModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 57.32 | 62.2 | 47.9 | 80.43 | 89.95 | 4.17 | |
| Synergisticdecoder=discriminative, ensemble=false2020.04 | 57.32 | 62.2 | 47.9 | 80.43 | 89.95 | 4.17 | |
| Synergisticdense labels=false2022.05 | 57.32 | 62.2 | 47.9 | 80.43 | 89.95 | 4.17 | |
| SynergisticModel Configuration=Single-model2026.05 | 57.32 | 62.2 | 47.9 | 80.43 | 89.95 | 4.17 | |
| FGABackbone=F-RCNNx101, External Knowledge=false, Ensemble=5x2019.04 | 57.2 | 69.3 | 55.65 | 86.73 | 94.05 | 3.14 | |
| HACANModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 57.17 | 64.22 | 50.88 | 80.63 | 89.45 | 4.2 | |
| HACANdecoder=discriminative, ensemble=false2020.04 | 57.17 | 64.22 | 50.88 | 80.63 | 89.45 | 4.2 | |
| FGABackbone=F-RCNNx101, External Knowledge=false2019.04 | 56.9 | 66.2 | 52.75 | 82.92 | 91.07 | 3.8 | |
| CAGModel Category=Graph-based Models, Decoder=Discriminative2020.04 | 56.64 | 63.49 | 49.85 | 80.63 | 90.15 | 4.11 | |
| CAGdecoder=discriminative, ensemble=false2020.04 | 56.64 | 63.49 | 49.85 | 80.63 | 90.15 | 4.11 | |
| USTC-YTHensemble=true, source=VisDial Challenge 2018 Leaderboard2019.02 | 56.47 | 61.44 | 47.65 | 78.13 | 87.88 | 4.65 | |
| DualVDmodel_type=single-step2019.11 | 56.32 | 63.23 | 49.25 | 80.23 | 89.7 | 4.11 | |
| DualVDdecoder=discriminative, ensemble=false2020.04 | 56.32 | 63.23 | 49.25 | 80.23 | 89.7 | 4.11 | |
| RvAmodel_type=single-step2019.11 | 55.59 | 63.03 | 49.03 | 80.4 | 89.83 | 4.18 | |
| RVAModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 55.59 | 63.03 | 49.03 | 80.4 | 89.83 | 4.18 | |
| RVAdecoder=discriminative, ensemble=false2020.04 | 55.59 | 63.03 | 49.03 | 80.4 | 89.83 | 4.18 | |
| RvAdense labels=false2022.05 | 55.59 | 63.03 | 49.03 | 80.4 | 89.83 | 4.18 | |
| RvAModel Configuration=Single-model2026.05 | 55.59 | 63.03 | 49.03 | 80.4 | 89.83 | 4.18 | |
| MS ConvAIensemble=true, source=VisDial Challenge 2018 Leaderboard2019.02 | 55.35 | 63.27 | 49.53 | 80.4 | 89.6 | 4.15 | |
| MTNModel Variant=Base2019.07 | 55.33 | — | — | — | — | — | |
| CorefMNmodel_type=single-step2019.11 | 54.7 | 61.5 | 47.55 | 78.1 | 88.8 | 4.4 | |
| CorefNMN2019.07 | 54.7 | — | — | — | — | — | |
| CorefNMNBackbone=ResNet-152, External Knowledge=true2019.04 | 54.7 | 61.5 | 47.55 | 78.1 | 88.8 | 4.4 | |
| CorefNMNModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 54.7 | 61.5 | 47.55 | 78.1 | 88.8 | 4.4 | |
| DVANModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 54.7 | 62.58 | 48.9 | 79.35 | 89.03 | 4.36 | |
| CorefNMNdecoder=discriminative, ensemble=false2020.04 | 54.7 | 61.5 | 47.55 | 78.1 | 88.8 | 4.4 | |
| CorefNMNdense labels=false2022.05 | 54.7 | 61.5 | 47.55 | 78.1 | 88.8 | 4.4 | |
| CorefNMNModel Configuration=Single-model2026.05 | 54.7 | 61.5 | 47.55 | 78.1 | 88.8 | 4.4 | |
| FGABackbone=VGG, External Knowledge=false, Ensemble=5x2019.04 | 54.5 | 67.3 | 53.4 | 85.28 | 92.7 | 3.54 | |
| VGNNmodel_type=single-step2019.11 | 52.82 | 61.37 | 47.33 | 77.98 | 87.83 | 4.57 | |
| GNNModel Category=Graph-based Models, Decoder=Discriminative2020.04 | 52.82 | 61.37 | 47.33 | 77.98 | 87.83 | 4.57 | |
| GNNModel Configuration=Single-model2026.05 | 52.82 | 61.37 | 47.33 | 77.98 | 87.83 | 4.57 | |
| FGABackbone=VGG, External Knowledge=false2019.04 | 52.1 | 63.7 | 49.58 | 80.97 | 88.55 | 4.51 | |
| FGAModel Category=Graph-based Models, Decoder=Discriminative2020.04 | 52.1 | 63.7 | 49.58 | 80.97 | 88.55 | 4.51 | |
| FGAEnsemble=true, Fine-tuning on dense annotations=false2019.11 | 52.1 | 67.3 | 53.4 | 85.28 | 92.7 | 3.54 | |
| FGAdecoder=discriminative, ensemble=false2020.04 | 52.1 | 63.7 | 49.58 | 80.98 | 88.55 | 4.51 | |
| FGAdense labels=false2022.05 | 52.1 | 63.7 | 49.58 | 80.97 | 88.55 | 4.51 | |
| FGAModel type=Ensemble, Fine-tuning on dense annotations=false2026.05 | 52.1 | 67.3 | 53.4 | 85.28 | 92.7 | 3.54 | |
| FGAModel Configuration=Single-model2026.05 | 52.1 | 63.7 | 49.58 | 80.97 | 88.55 | 4.51 | |
| LF-AttModel Configuration=Single-model2026.05 | 49.76 | 57.07 | 42.08 | 74.82 | 85.05 | 5.41 | |
| MN-Attmodel_type=single-step2019.11 | 49.58 | 56.9 | 42.43 | 74 | 84.35 | 5.59 | |
| MN-AttModel Configuration=Single-model2026.05 | 49.58 | 56.9 | 42.42 | 74 | 84.35 | 5.59 | |
| MNmodel_type=single-step2019.11 | 47.5 | 55.49 | 40.98 | 72.3 | 83.3 | 5.92 | |
| MN2019.07 | 47.5 | — | — | — | — | — | |
| MNExternal Knowledge=false2019.04 | 47.5 | 55.5 | 40.98 | 72.3 | 83.3 | 5.92 | |
| MNModel Category=Attention-based Models, Decoder=Discriminative2020.04 | 47.5 | 55.49 | 40.98 | 72.3 | 83.3 | 5.92 | |
| MNdecoder=discriminative, ensemble=false2020.04 | 47.5 | 55.49 | 40.98 | 72.3 | 83.3 | 5.92 | |
| MNModel Configuration=Single-model2026.05 | 47.5 | 55.49 | 40.98 | 72.3 | 83.3 | 5.92 | |
| HREExternal Knowledge=false2019.04 | 45.5 | 54.2 | 39.93 | 70.45 | 81.5 | 6.41 | |
| HREmodel_type=single-step2019.11 | 45.46 | 54.16 | 39.93 | 70.47 | 81.5 | 6.41 | |
| HRE2019.07 | 45.46 | — | — | — | — | — | |
| HREModel Category=Fusion-based Models, Decoder=Discriminative2020.04 | 45.46 | 54.16 | 39.93 | 70.45 | 81.5 | 6.41 | |
| HREdecoder=discriminative, ensemble=false2020.04 | 45.46 | 54.16 | 39.93 | 70.45 | 81.5 | 6.41 | |
| HREModel Configuration=Single-model2026.05 | 45.46 | 54.16 | 39.93 | 70.45 | 81.5 | 6.41 | |
| LFmodel_type=single-step2019.11 | 45.31 | 55.42 | 40.95 | 72.45 | 82.83 | 5.95 | |
| LF2019.07 | 45.31 | — | — | — | — | — | |
| LFModel Category=Fusion-based Models, Decoder=Discriminative2020.04 | 45.31 | 55.42 | 40.95 | 72.45 | 82.83 | 5.95 | |
| LFdecoder=discriminative, ensemble=false2020.04 | 45.31 | 55.42 | 40.95 | 72.45 | 82.83 | 5.95 | |
| LFModel Configuration=Single-model2026.05 | 45.31 | 55.42 | 40.95 | 72.45 | 82.83 | 5.95 | |
| LFExternal Knowledge=false2019.04 | 45.3 | 55.4 | 40.95 | 72.45 | 82.83 | 5.95 | |
| LF-Attmodel_type=single-step2019.11 | 40.76 | 57.07 | 42.08 | 74.82 | 85.05 | 5.41 |