Semantic Consistency Evaluation on TIFA
93.8Avg Answering AccuracyVisualPrompter
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VisualPrompterGenerative Model=Flux-dev2025.06 | 93.8 | 83 | |
| VisualPrompterGenerative Model=Janus-Pro2025.06 | 93.7 | 83 | |
| NeuroPromptsGenerative Model=Janus-Pro2025.06 | 89.8 | 74.6 | |
| BaselineGenerative Model=Flux-dev2025.06 | 87.9 | 78.4 | |
| PromptistGenerative Model=Janus-Pro2025.06 | 86.9 | 76.2 | |
| BaselineGenerative Model=Janus-Pro2025.06 | 85.7 | 78.4 | |
| PromptistGenerative Model=Flux-dev2025.06 | 85.3 | 76.2 | |
| NeuroPromptsGenerative Model=Flux-dev2025.06 | 84 | 74.6 | |
| VisualPrompterGenerative Model=SD 2.12025.06 | 82.8 | 83 | |
| VisualPrompterGenerative Model=SD 1.52025.06 | 80.7 | 83 | |
| BaselineGenerative Model=SD 2.12025.06 | 80.4 | 78.4 | |
| PromptistGenerative Model=SD 2.12025.06 | 77.2 | 76.2 | |
| NeuroPromptsGenerative Model=SD 2.12025.06 | 75.5 | 74.6 | |
| BaselineGenerative Model=SD 1.52025.06 | 75 | 78.4 | |
| PromptistGenerative Model=SD 1.52025.06 | 71.4 | 76.2 | |
| NeuroPromptsGenerative Model=SD 1.52025.06 | 62.8 | 74.6 | |
| BeautifulPromptGenerative Model=Janus-Pro2025.06 | 62 | 53.5 | |
| BeautifulPromptGenerative Model=Flux-dev2025.06 | 57.4 | 53.5 | |
| BeautifulPromptGenerative Model=SD 2.12025.06 | 53.6 | 53.5 | |
| BeautifulPromptGenerative Model=SD 1.52025.06 | 50.9 | 53.5 |