Description2Code Generation on Synthetic Eval Dataset 1.0 (State)
93.69BLEULlama-VL-TUG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama-VL-TUG2026.01 | 93.69 | 93.6941 | 93.8 | 95.9338 | 0.733 | 96.99 | |
| GPT-4o-mini2026.01 | 92.78 | 92.7769 | 93.65 | 94.8294 | 0.7213 | 95.82 | |
| Gemma3-12B-Instruction-TunedModel Size=12B, Variant=Instruction-Tuned2026.01 | 51.86 | 51.8634 | 31.89 | 79.6331 | 0.2222 | 81.98 | |
| Qwen2.5-VL-7B-InstructModel Size=7B, Variant=Instruct2026.01 | 38 | 38.0818 | 29.94 | 58.7889 | -0.2469 | 53.91 | |
| MiniCPM-V-2-62026.01 | 29.6 | 29.6741 | 26.5 | 50.5644 | -0.4541 | 43.62 | |
| Llama3.2-11BModel Size=11B2026.01 | 28.85 | 28.8777 | 20.65 | 47.7941 | -0.4619 | 42.04 |