Knowledge-intensive image editing on KrisBench (test)
79.8Factual AccuracyGPT-4o
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4omodel_source=closed-source2026.02 | 79.8 | 81.37 | 78.32 | 80.09 | |
| UniCoTreasoning_protocol=w/ Reasoning, reasoning_type=interleaved reasoning and refinement2026.02 | 71.85 | 67.16 | 63.68 | 68 | |
| UniReasonreasoning_protocol=w/ Reasoning, reasoning_type=interleaved reasoning and refinement2026.02 | 70.67 | 72.38 | 56.89 | 68.23 | |
| LightFusion-Worldreasoning_protocol=w/o Reasoning2026.02 | 66.69 | 63.5 | 52.38 | 61.85 | |
| BAGELreasoning_protocol=w/ Reasoning, reasoning_type=textual reasoning only2026.02 | 66.18 | 61.92 | 49.02 | 60.18 | |
| Gemini 2.0model_source=closed-source2026.02 | 65.26 | 59.65 | 62.9 | 62.41 | |
| OmniGen2reasoning_protocol=w/o Reasoning2026.02 | 57.36 | 44.2 | 47.79 | 49.71 | |
| Uniworld V1reasoning_protocol=w/o Reasoning2026.02 | 47.71 | 44.8 | 47.92 | 50.27 |