Description2Code Generation on Synthetic Eval Dataset Class 1.0
0.9656BLEULlama-VL-TUG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama-VL-TUG2026.01 | 0.9656 | 96.5596 | 0.9889 | 98.5066 | 0.6291 | 0.9789 | |
| GPT-4o-mini2026.01 | 0.9029 | 90.2938 | 0.9571 | 94.9272 | 0.5473 | 0.9547 | |
| Qwen2.5-VL-7B-InstructModel Size=7B, Variant=Instruct2026.01 | 0.3491 | 34.9999 | 0.4559 | 61.5165 | -0.3032 | 0.6486 | |
| Gemma3-12B-Instruction-TunedModel Size=12B, Variant=Instruction-Tuned2026.01 | 0.3469 | 34.7061 | 0.3975 | 54.5017 | -0.4732 | 0.5856 | |
| Llama3.2-11B-Vision-InstructModel Size=11B, Variant=Vision-Instruct2026.01 | 0.3238 | 32.3804 | 0.482 | 60.4781 | -0.3297 | 0.6389 | |
| MiniCPM-V-2-62026.01 | 0.2144 | 21.7403 | 0.3136 | 51.1385 | -0.3994 | 0.5044 |