UI-to-Code Generation on Design2Code HARD (80 samples)
96.3Win RateUI2Code-N
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| UI2Code-NComparison Baseline=Qwen2.5-VL-72B, Evaluation Protocol=Human Evaluation2025.11 | 96.3 | 2.5 | 1.3 | 98.8 | |
| UI2Code-NComparison Baseline=Claude-4-Sonnet, Evaluation Protocol=Human Evaluation2025.11 | 63.8 | 16.3 | 20 | 80 | |
| UI2Code-NComparison Baseline=GPT-5, Evaluation Protocol=Human Evaluation2025.11 | 56.3 | 16.3 | 27.5 | 72.5 | |
| UI2Code-NComparison Baseline=Gemini-2.5-Pro, Evaluation Protocol=Human Evaluation2025.11 | 52.5 | 12.5 | 35 | 65 |