Text-to-Image Generation on GenEval++ (test)
95Color ScoreGPT Image + R3-Refiner
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GPT Image + R3-RefinerRefinement=R3-Refiner, Evaluator=Qwen3-VL-235B2026.05 | 95 | 90 | 92.5 | 67.5 | 57.5 | 87.5 | 90 | 82.9 | |
| Qwen-Image + R3-RefinerRefinement=R3-Refiner, Evaluator=Qwen3-VL-235B2026.05 | 92.5 | 77.5 | 77.5 | 72.5 | 55 | 70 | 55 | 71.4 | |
| GPT ImageEvaluator=Qwen3-VL-235B2026.05 | 92.5 | 90 | 82.5 | 62.5 | 60 | 87.5 | 80 | 79.3 | |
| Banana + R3-RefinerRefinement=R3-Refiner, Evaluator=Qwen3-VL-235B2026.05 | 92.5 | 85 | 72.5 | 77.5 | 57.5 | 77.5 | 97.5 | 80 | |
| BananaEvaluator=Qwen3-VL-235B2026.05 | 87.5 | 77.5 | 62.5 | 70 | 50 | 77.5 | 90 | 73.6 | |
| Qwen-ImageEditor=Qwen-Image-Edit, Evaluator=Qwen3-VL-235B2026.05 | 80 | 70 | 60 | 70 | 50 | 72.5 | 55 | 65.4 | |
| Bagel + R3-RefinerRefinement=R3-Refiner, Evaluator=Qwen3-VL-235B2026.05 | 65 | 65 | 50 | 40 | 30 | 67.5 | 55 | 53.2 | |
| OmniGen2 + R3-RefinerRefinement=R3-Refiner, Evaluator=Qwen3-VL-235B2026.05 | 65 | 30 | 32.5 | 30 | 10 | 52.5 | 35 | 36.4 | |
| OmniGen2Evaluator=Qwen3-VL-235B2026.05 | 62.5 | 25 | 15 | 30 | 10 | 47.5 | 30 | 31.4 | |
| BagelEvaluator=Qwen3-VL-235B2026.05 | 57.5 | 50 | 35 | 30 | 17.5 | 62.5 | 42.5 | 42.1 | |
| SD-3-MedEvaluator=Qwen3-VL-235B2026.05 | 55 | 50 | 12.5 | 35 | 17.5 | 15 | 22.5 | 29.6 | |
| Janus-ProEvaluator=Qwen3-VL-235B2026.05 | 45 | 30 | 12.5 | 30 | 7.5 | 35 | 12.5 | 24.6 | |
| FLUX.1Evaluator=Qwen3-VL-235B2026.05 | 35 | 62.5 | 15 | 27.5 | 20 | 37.5 | 22.5 | 31.4 |