Description2Code Generation on Synthetic Eval Dataset Sequence 1.0
1BLEULlama-VL-TUG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama-VL-TUG2026.01 | 1 | 100 | 1 | 100 | 1.0068 | 1 | |
| GPT-4o-mini2026.01 | 0.8511 | 85.1115 | 0.8815 | 96.7221 | 0.8917 | 0.9997 | |
| Gemma3-12B-Instruction-TunedModel Size=12B, Variant=Instruction-Tuned2026.01 | 0.4614 | 46.2925 | 0.7616 | 88.6449 | 0.2405 | 0.8791 | |
| Qwen2.5-VL-7B-InstructModel Size=7B, Variant=Instruct2026.01 | 0.3698 | 37.644 | 0.6798 | 80.9233 | 0.1786 | 0.7054 | |
| Llama3.2-11B-Vision-InstructModel Size=11B, Variant=Vision-Instruct2026.01 | 0.2793 | 28.1335 | 0.6721 | 74.8698 | -0.353 | 0.5829 | |
| MiniCPM-V-2-62026.01 | 0.258 | 26.6537 | 0.5595 | 72.8661 | -0.1069 | 0.5815 |