Description2Code Generation on Synthetic Eval Dataset Block 1.0
0.8994BLEULlama-VL-TUG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama-VL-TUG2026.01 | 0.8994 | 89.9374 | 0.9547 | 94.6979 | 0.7247 | 0.844 | |
| GPT-4o-mini2026.01 | 0.108 | 10.979 | 0.2684 | 30.7947 | -0.5459 | 0.2426 | |
| Gemma3-12B-Instruction-TunedModel Size=12B, Variant=Instruction-Tuned2026.01 | 0.0663 | 6.7988 | 0.2753 | 34.8009 | -0.5153 | 0.2684 | |
| Qwen2.5-VL-7B-InstructModel Size=7B, Variant=Instruct2026.01 | 0.0301 | 5.113 | 0.2592 | 27.9851 | -0.6851 | 0.2418 | |
| Llama3.2-11B-Vision-InstructModel Size=11B, Variant=Vision-Instruct2026.01 | 0.029 | 4.2783 | 0.2111 | 32.7885 | -0.5828 | 0.2457 | |
| MiniCPM-V-2-62026.01 | 0.0168 | 3.574 | 0.2355 | 22.2868 | -0.7862 | 0.2055 |