Trace Captioning on COCO
29.4CIDErT2D + Diffusion
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| T2D + Diffusion2025.10 | 29.4 | 77.6 | |
| T2D + Noise2025.10 | 29.3 | 78.1 | |
| T2D + Noise + External knowledge2025.10 | 28.2 | 78.2 | |
| T2D + Mem.2025.10 | 27.9 | 78.7 | |
| Patch-ionerConfiguration=T2D + Mem., Number of Parameters=0.21B, Adaptation strategy=Patch-based2025.10 | 27.9 | 78.7 | |
| T2D + Noise + Filtered knowledge2025.10 | 27.4 | 78.8 | |
| ViECapreproduced=true2025.10 | 24.3 | 74.4 | |
| MeaCapreproduced=true2025.10 | 22.5 | 74.4 | |
| Diffusion Bridgereproduced=true2025.10 | 21.8 | 74.8 | |
| AlphaCLIP2025.10 | 21.3 | 75.4 | |
| Llava1.5 One-VisionAdaptation strategy=Visual Prompting, Number of Parameters=4B2025.10 | 21.2 | 75.9 | |
| IFCapreproduced=true2025.10 | 20.8 | 73.2 | |
| DeCapreproduced=true2025.10 | 20.5 | 75.3 | |
| Llava1.5 One-VisionAdaptation strategy=Crop, Number of Parameters=4B2025.10 | 19.7 | 75.4 | |
| Qwen2.5 VLAdaptation strategy=Crop, Number of Parameters=3B2025.10 | 18.4 | 73.9 | |
| Qwen2.5 VLAdaptation strategy=Visual Prompting, Number of Parameters=3B2025.10 | 17.4 | 74 | |
| Qwen3 VLAdaptation strategy=Visual Prompting, Number of Parameters=4B2025.10 | 9.1 | 70.7 | |
| Qwen3 VLAdaptation strategy=Crop, Number of Parameters=4B2025.10 | 7.6 | 69.3 |