Description2Code Generation on Synthetic Eval Dataset C4 1.0
0.9609BLEULlama-VL-TUG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama-VL-TUG2026.01 | 0.9609 | 96.088 | 0.9824 | 97.8606 | 0.4821 | 0.9711 | |
| GPT-4o-mini2026.01 | 0.8229 | 82.2867 | 0.8841 | 88.4546 | 0.2825 | 0.8299 | |
| MiniCPM-V-2-62026.01 | 0.0129 | 1.9129 | 0.1401 | 21.1324 | -0.707 | 0.2614 | |
| Gemma3-12B-Instruction-TunedModel Size=12B, Variant=Instruction-Tuned2026.01 | 0.0093 | 0.9878 | 0.1259 | 23.6268 | -0.6678 | 0.2728 | |
| Qwen2.5-VL-7B-InstructModel Size=7B, Variant=Instruct2026.01 | 0.0059 | 1.2289 | 0.1066 | 24.0475 | -0.6474 | 0.2711 | |
| Llama3.2-11B-Vision-InstructModel Size=11B, Variant=Vision-Instruct2026.01 | 0.0008 | 0.7302 | 0.0965 | 23.2782 | -0.656 | 0.2463 |