Image2Description on Synthetic Eval Dataset State
0.8919BLEULlama-VL-TUG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama-VL-TUG2026.01 | 0.8919 | 89.1866 | 0.9227 | 95.2614 | 0.6111 | 0.8635 | |
| GPT-4o-mini2026.01 | 0.6634 | 66.3353 | 0.7468 | 79.3858 | 0.4126 | 0.6664 | |
| Gemma3-12B-Instruction-Tuned2026.01 | 0.6292 | 62.9213 | 0.7348 | 75.3195 | 0.4053 | 0.664 | |
| Llama3.2-11B-Vision-Instruct2026.01 | 0.622 | 62.1973 | 0.7418 | 75.4259 | 0.3177 | 0.6388 | |
| Qwen2.5-VL-7B-Instruct2026.01 | 0.6082 | 60.8156 | 0.6896 | 76.0601 | 0.3481 | 0.6437 | |
| MiniCPM-V-2-62026.01 | 0.1269 | 12.6916 | 0.4379 | 28.6882 | -0.8319 | 0.3387 |