Infrastructure Improvement Proposal on Mapillary (test)
84.42RecallQwen2-VL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen2-VL2026.03 | 84.42 | 22.51 | 34.28 | 22.18 | |
| Ours BaselineVision Encoder=ViT-B, Text Encoder=Long-CLIP2026.03 | 77.77 | 80.58 | 79.15 | 63.83 | |
| Ours BaselineVision Encoder=Long-CLIP, Text Encoder=Long-CLIP2026.03 | 77.1 | 81.54 | 79.26 | 64.11 | |
| LLaVA-1.52026.03 | 75.74 | 15.51 | 22.93 | 14.86 | |
| Ours BaselineVision Encoder=CLIP, Text Encoder=Long-CLIP2026.03 | 75.63 | 82.22 | 78.79 | 63.25 | |
| Ours BaselineVision Encoder=ResNet-50, Text Encoder=Long-CLIP2026.03 | 74.76 | 79.76 | 77.18 | 61.38 | |
| InternVL22026.03 | 72.36 | 22.63 | 32.74 | 21.85 | |
| OD-RASE (ResNet-50)Vision Encoder=ResNet-50, Text Encoder=RoBERTa-Base, Evaluation Setting=zero-shot, Training Dataset=BDD100K2026.03 | 65.49 | 68.91 | 67.16 | 34.52 | |
| OD-RASE (ViT-B)Vision Encoder=ViT-B, Text Encoder=RoBERTa-Base, Evaluation Setting=zero-shot, Training Dataset=BDD100K2026.03 | 63.65 | 73.18 | 68.08 | 37.12 | |
| OD-RASE (CLIP)Vision Encoder=CLIP, Text Encoder=RoBERTa-Base, Evaluation Setting=zero-shot, Training Dataset=BDD100K2026.03 | 63.09 | 74.26 | 68.22 | 37.28 | |
| OD-RASE (Long-CLIP)Vision Encoder=Long-CLIP, Text Encoder=RoBERTa-Base, Evaluation Setting=zero-shot, Training Dataset=BDD100K2026.03 | 62.34 | 75.57 | 68.32 | 38.96 | |
| GPT-4oEvaluation Setting=zero-shot2026.03 | 61.04 | 24.97 | 34.27 | 23.08 | |
| GPT-4o2026.03 | 51.87 | 19.66 | 27.81 | 18.59 | |
| Phi-32026.03 | 51.35 | 21.6 | 28.73 | 18.24 | |
| LLaVA-1.5Evaluation Setting=zero-shot2026.03 | 42.17 | 23.71 | 23.75 | 16.82 | |
| Phi-3Evaluation Setting=zero-shot2026.03 | 41.27 | 22.13 | 27.47 | 17.48 | |
| Qwen2-VLEvaluation Setting=zero-shot2026.03 | 40.99 | 17.93 | 23.97 | 15.55 | |
| InternVL2Evaluation Setting=zero-shot2026.03 | 34.57 | 14.18 | 18.83 | 11.97 |