UI-to-Code Generation on Design2Code HARD (Preference Metrics)
91.3Win RateUI2CodeN
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| UI2CodeNComparison Baseline=Qwen2.5-VL-72B, Evaluator=VLM-based judge2025.11 | 91.3 | 5 | 3.8 | 96.3 | |
| UI2CodeNComparison Baseline=Claude-4-Sonnet, Evaluator=VLM-based judge2025.11 | 63.8 | 17.5 | 18.8 | 81.3 | |
| UI2CodeNComparison Baseline=GPT-5, Evaluator=VLM-based judge2025.11 | 53.8 | 16.3 | 30 | 70 | |
| UI2CodeNComparison Baseline=Gemini-2.5-Pro, Evaluator=VLM-based judge2025.11 | 40 | 21.3 | 38.8 | 63.8 |