Vision-Language Captioning on RescueNet (test)
99.78CLIPScoreQwenVL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QwenVLDecoder context=Transformer, KG=No2025.09 | 99.78 | 99.92 | |
| LLaVADecoder context=CNN-LSTM, KG=No2025.09 | 99.44 | 98.78 | |
| VLCEDecoder=Transformer, Baseline=QwenVL, KG=Yes2025.09 | 73.64 | 95.33 | |
| VLCEDecoder=CNN-LSTM, Baseline=LLaVA, KG=Yes2025.09 | 52.95 | 54.51 | |
| LLaVADecoder context=CNN-LSTM, KG=Yes2025.09 | 47.05 | 45.49 | |
| QwenVLDecoder context=Transformer, KG=Yes2025.09 | 26.36 | 4.67 | |
| VLCEDecoder=CNN-LSTM, Baseline=LLaVA, KG=No2025.09 | 0.56 | 1.22 | |
| VLCEDecoder=Transformer, Baseline=QwenVL, KG=No2025.09 | 0.22 | 0.08 |