ResearchBenchmarksImage Generation on LLM-Judge Evaluation SetFollow37.2QualityTuna-R21.70425.72729.7533.773Apr 27, 2026Evaluation ResultsMethodMethodLinksQualityDiversityTuna-RLLM Judge=Claude Opus 4.7LLM Judge=Claude Opus 4.72026.0437.229.9Tuna-RLLM Judge=GPT-5.4LLM Judge=GPT-5.42026.0435.730.9Tuna-2LLM Judge=Claude Opus 4.7LLM Judge=Claude Opus 4.72026.0434.841.9Tuna-2LLM Judge=GPT-5.4LLM Judge=GPT-5.42026.0432.148.4TunaLLM Judge=Claude Opus 4.7LLM Judge=Claude Opus 4.72026.0428.128.2TunaLLM Judge=GPT-5.4LLM Judge=GPT-5.42026.0422.320.6