Multiview Pedestrian Detection on MultiviewX (test)
97.3MODAPVH-Enc
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PVH-EncExtra Info=true2026.06 | 97.3 | 95 | 99.5 | 97.9 | 98.7 | |
| TrackTacularExtra Info=true2026.06 | 96.5 | 75 | 99.4 | 97.1 | 98.2 | |
| MVFPExtra Info=false2026.06 | 95.7 | 85.1 | 98.4 | 97.2 | 97.8 | |
| MVDGCExtra Info=false2026.06 | 95.7 | 93 | 98.8 | 96.9 | 97.8 | |
| MVAugExtra Info=false2026.06 | 95.3 | 89.7 | 99.4 | 95.9 | 97.6 | |
| 3DROMEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 95 | 84.9 | 99 | 96.1 | 97.5 | |
| 3DROMExtra Info=false2026.06 | 95 | 84.9 | 99 | 96.1 | 97.5 | |
| MVTTExtra Info=true2026.06 | 95 | 92.8 | 99.4 | 95.6 | 97.5 | |
| EarlybirdExtra Info=false2026.06 | 94.2 | 90.1 | 98.6 | 95.7 | 97.1 | |
| MVDeTrImageNet (pre-train)=true2021.09 | 93.7 | 91.3 | 99.5 | 94.2 | — | |
| MVDeTrEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 93.7 | 91.3 | 99.5 | 94.2 | 97.8 | |
| MVDeTr (ours)2021.08 | 93.7 | 91.3 | 99.5 | 94.2 | — | |
| MVDetrExtra Info=false2026.06 | 93.7 | 91.3 | 99.5 | 94.5 | 96.9 | |
| MVDeTrAugmentation=false2021.08 | 93.1 | 90.9 | 98.5 | 94.4 | — | |
| MVDeTrAggregation=convolution2021.08 | 93 | 91.1 | 99.4 | 93.6 | — | |
| MVDeTrPer-view loss=false2021.08 | 92.6 | 90.6 | 99.3 | 93.3 | — | |
| SHOTImageNet (pre-train)=false2021.09 | 88.3 | 82 | 96.6 | 91.5 | — | |
| SHOTEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 88.3 | 82 | 96.6 | 91.5 | 94 | |
| SHOTExtra Info=false2026.06 | 88.3 | 82 | 96.6 | 91.5 | 94 | |
| Proposed Method (DropView)ImageNet (pre-train)=true2021.09 | 88.2 | 79.9 | 96.8 | 91.2 | — | |
| Proposed MethodImageNet (pre-train)=true2021.09 | 86.9 | 79.8 | 97.2 | 89.6 | — | |
| MVDetAugmentation=true2021.08 | 85.6 | 78 | 96.4 | 89.2 | — | |
| VolumetricEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 84.2 | 80.3 | 97.5 | 86.4 | 91.6 | |
| MVDetMultiview aggregation=feature maps, Spatial aggregation=large kernel convolution2020.07 | 83.9 | 79.6 | 96.8 | 86.7 | — | |
| MVDetImageNet (pre-train)=false2021.09 | 83.9 | 79.6 | 96.8 | 86.7 | — | |
| MVDetEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 83.9 | 79.6 | 96.8 | 86.7 | 91.5 | |
| MVDet2021.08 | 83.9 | 79.6 | 96.8 | 86.7 | — | |
| MVDetExtra Info=false2026.06 | 83.9 | 79.6 | 96.8 | 86.7 | 91.5 | |
| Supervised View-Wise Contribution WeightingEvaluation protocol=cross-scene, Trained on=CVCS, Finetuning=5% of labeled data, Domain adaptation=true (ft+da)2024.05 | 83.8 | 76.5 | 97.1 | 86.4 | 91.4 | |
| Supervised View-Wise Contribution WeightingEvaluation protocol=cross-scene, Trained on=CVCS, Finetuning=5% of labeled data (ft)2024.05 | 81.1 | 77.2 | 95 | 85.6 | 90.1 | |
| Proposed MethodImageNet (pre-train)=false2021.09 | 78.6 | 78.1 | 96.8 | 81.3 | — | |
| MVDet (w/o large kernel)Multiview aggregation=feature maps, Spatial aggregation=N/A2020.07 | 77.2 | 76.3 | 89.5 | 85.9 | — | |
| Deep-OcclusionMultiview aggregation=anchor box features, Spatial aggregation=CRF + mean-field inference, re-implemented=true2020.07 | 75.2 | 54.7 | 97.8 | 80.2 | — | |
| Deep-OcclusionImageNet (pre-train)=false2021.09 | 75.2 | 54.7 | 97.8 | 80.2 | — | |
| DeepOcc.Evaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 75.2 | 54.7 | 97.8 | 80.2 | 88.1 | |
| Deep-Occlusion2021.08 | 75.2 | 54.7 | 97.8 | 80.2 | — | |
| Deep-OccExtra Info=false2026.06 | 75.2 | 54.7 | 97.8 | 80.2 | 88.1 | |
| MVDet (project results)Multiview aggregation=detection results, Spatial aggregation=large kernel convolution2020.07 | 73.2 | 79.7 | 87.6 | 85 | — | |
| DeepMCDMultiview aggregation=anchor box features, Spatial aggregation=N/A, re-implemented=true2020.07 | 70 | 73 | 85.7 | 83.3 | — | |
| DeepMCDImageNet (pre-train)=false2021.09 | 70 | 73 | 85.7 | 83.3 | — | |
| DeepMCDEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 70 | 73 | 85.7 | 83.3 | 84.5 | |
| DeepMCD2021.08 | 70 | 73 | 85.7 | 83.3 | — | |
| DeepMCDExtra Info=false2026.06 | 70 | 73 | 85.7 | 83.3 | 84.5 | |
| MVDet (project images)Multiview aggregation=RGB image pixels, Spatial aggregation=large kernel convolution2020.07 | 19.5 | 51 | 84.4 | 24 | — | |
| RCNN & clusteringMultiview aggregation=detection results, Spatial aggregation=clustering, re-implemented=true2020.07 | 18.7 | 46.4 | 63.5 | 43.9 | — | |
| RCNN ClusteringImageNet (pre-train)=false2021.09 | 18.7 | 46.4 | 63.5 | 43.9 | — | |
| RCNNEvaluation protocol=single-scene, Trained on=MultiviewX2024.05 | 18.7 | 46.4 | 63.5 | 43.9 | 51.9 | |
| RCNN & clustering2021.08 | 18.7 | 46.4 | 63.5 | 43.9 | — | |
| RCNN-basedExtra Info=false2026.06 | 18.7 | 46.4 | 63.5 | 43.9 | 51.9 |