UI Generation on 429 human-rated UI pairs 1.0 (test)
1,342Elo ScoreClaude Sonnet 4.5
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Claude Sonnet 4.5Evaluator=Human2026.05 | 1,342 | 1 | — | — | — | |
| Claude Sonnet 4.5Evaluator=MLLM2026.05 | 1,314 | 1 | — | — | — | |
| Claude Sonnet 4.5Evaluator=DTW2026.05 | 1,210 | 1 | — | — | — | |
| GPT 5.1 CodexEvaluator=MLLM2026.05 | 1,162 | 2 | — | — | — | |
| Claude Sonnet 4.5Evaluator=WMD2026.05 | 1,146 | 1 | — | — | — | |
| Qwen3Coder 480BEvaluator=Human2026.05 | 1,119 | 2 | — | — | — | |
| Claude Sonnet 4.5Evaluator=eBLEU2026.05 | 1,098 | 1 | — | — | — | |
| Qwen3Coder 480BEvaluator=WMD2026.05 | 1,052 | 2 | — | — | — | |
| Gemini Pro 2.5Evaluator=Human2026.05 | 1,048 | 3 | — | — | — | |
| Gemini Pro 2.5Evaluator=WMD2026.05 | 1,033 | 3 | — | — | — | |
| Gemini Pro 2.5Evaluator=eBLEU2026.05 | 1,024 | 2 | — | — | — | |
| GPT-OSS 120BEvaluator=DTW2026.05 | 1,021 | 2 | — | — | — | |
| Gemini Pro 2.5Evaluator=DTW2026.05 | 1,008 | 3 | — | — | — | |
| GPT-OSS 120BEvaluator=eBLEU2026.05 | 999 | 3 | — | — | — | |
| Qwen3Coder 30BEvaluator=eBLEU2026.05 | 998 | 4 | — | — | — | |
| Qwen3Coder 480BEvaluator=MLLM2026.05 | 996 | 3 | — | — | — | |
| Qwen3Coder 30BEvaluator=WMD2026.05 | 983 | 4 | — | — | — | |
| Qwen3Coder 30BEvaluator=Human2026.05 | 972 | 4 | — | — | — | |
| GPT 5.1 CodexEvaluator=eBLEU2026.05 | 969 | 5 | — | — | — | |
| Qwen3Coder 480BEvaluator=eBLEU2026.05 | 967 | 6 | — | — | — | |
| Qwen3Coder 30BEvaluator=DTW2026.05 | 964 | 4 | — | — | — | |
| GPT-OSS 20BEvaluator=eBLEU2026.05 | 957 | 7 | — | — | — | |
| GPT 5.1 CodexEvaluator=DTW2026.05 | 948 | 5 | — | — | — | |
| Qwen3Coder 480BEvaluator=DTW2026.05 | 944 | 6 | — | — | — | |
| Qwen3Coder 30BEvaluator=MLLM2026.05 | 942 | 4 | — | — | — | |
| GPT 5.1 CodexEvaluator=WMD2026.05 | 940 | 5 | — | — | — | |
| GPT 5.1 CodexEvaluator=Human2026.05 | 928 | 5 | — | — | — | |
| GPT-OSS 120BEvaluator=WMD2026.05 | 928 | 6 | — | — | — | |
| GPT-OSS 20BEvaluator=WMD2026.05 | 915 | 7 | — | — | — | |
| GPT-OSS 20BEvaluator=DTW2026.05 | 909 | 7 | — | — | — | |
| Gemini Pro 2.5Evaluator=MLLM2026.05 | 874 | 5 | — | — | — | |
| GPT-OSS 120BEvaluator=MLLM2026.05 | 858 | 6 | — | — | — | |
| GPT-OSS 20BEvaluator=MLLM2026.05 | 852 | 7 | — | — | — | |
| GPT-OSS 20BEvaluator=Human2026.05 | 826 | 6 | — | — | — | |
| GPT-OSS 120BEvaluator=Human2026.05 | 776 | 7 | — | — | — | |
| DTW2026.05 | — | — | 0.25 | 0.37 | 68.1 | |
| eBLEU2026.05 | — | — | 0.39 | 0.23 | 61.1 | |
| MLLM2026.05 | — | — | 0.71 | 0.44 | 71.1 | |
| WMD2026.05 | — | — | 0.96 | 0.46 | 73 |