Video Semantic Segmentation on Waymo
94.9mIoUDINOv3 + GMMix
Evaluation Results
| Method | Links | |
|---|---|---|
| DINOv3 + GMMixPre-train=Image, Scale=Large2026.05 | 94.9 | |
| DINOv3 + GMMixPre-train=Image, Scale=Base2026.05 | 93.9 | |
| DINOv3-distPre-train=Image, Scale=Large2026.05 | 78.8 | |
| DINOv3-distPre-train=Image, Scale=Base2026.05 | 78.7 | |
| 4DS-distPre-train=Video, Scale=Base2026.05 | 76.3 | |
| 4DSPre-train=Video, Scale=Large2026.05 | 75.9 | |
| VideoMAEPre-train=Video, Scale=Large2026.05 | 74.9 | |
| V-JEPAPre-train=Video, Scale=Large2026.05 | 73.3 | |
| RVMPre-train=Video, Scale=Large2026.05 | 73.2 | |
| VideoMAEPre-train=Video, Scale=Base2026.05 | 73.1 | |
| 4DSPre-train=Video, Scale=Base2026.05 | 72.7 | |
| RVMPre-train=Video, Scale=Base2026.05 | 71.1 | |
| DINOv2-distPre-train=Image, Scale=Large2026.05 | 51.7 |