Image-to-Image Fidelity Assessment on StableI2I-Bench 1.0 (test)
85.4Binary Accuracy (Structure)StableI2I
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| StableI2ITraining=Specialized training for I2I fidelity assessment, Template=Fixed task template2026.05 | 85.4 | 82.8 | 99.1 | 89.1 | 83.7 | 67.3 | 98 | 83 | |
| Gemini-3-proModel Type=Proprietary2026.05 | 71.52 | 83.61 | 91.72 | 82.28 | 62.19 | 63.69 | 75.56 | 67.15 | |
| Gemini-2.5-proModel Type=Proprietary2026.05 | 66.67 | 79.9 | 90.7 | 79.09 | 56.66 | 58.6 | 37.2 | 50.82 | |
| Claude-Sonnet-4.5Model Type=Proprietary2026.05 | 66.2 | 70.1 | 89.7 | 75.33 | 62.4 | 54.4 | 73.3 | 63.37 | |
| GPT-5Model Type=Proprietary2026.05 | 65.5 | 83 | 93.2 | 80.57 | 54.6 | 60.2 | 51 | 55.27 | |
| Claude-Sonnet-4.5-thinkModel Type=Proprietary, Reasoning Mode=think2026.05 | 63.8 | 69.4 | 84.7 | 72.63 | 62.5 | 56.2 | 65.2 | 61.3 | |
| GPT-4oModel Type=Proprietary2026.05 | 59.9 | 79.7 | 94.7 | 78.1 | 46.6 | 60.8 | 71.1 | 59.5 | |
| Qwen3VL-32B-InstructModel Type=Open-Source2026.05 | 53.2 | 73.6 | 87.7 | 71.5 | 34.9 | 48.9 | 56.3 | 46.7 | |
| Grok-4.1Model Type=Proprietary2026.05 | 50.5 | 73.7 | 77.9 | 67.37 | 38.5 | 56.3 | 28.7 | 41.17 | |
| InternVL-3.5-38BModel Type=Open-Source2026.05 | 50.1 | 64.9 | 81.7 | 65.57 | 42.3 | 39.4 | 31.6 | 37.77 | |
| Qwen3VL-8B-InstructModel Type=Open-Source2026.05 | 36.6 | 55.6 | 81.6 | 57.93 | 13.8 | 31.7 | 63.6 | 36.37 | |
| InternVL-3.5-8BModel Type=Open-Source2026.05 | 36.3 | 64.6 | 59.1 | 53.33 | 13 | 21.3 | 28.1 | 20.8 |