Prompt Adherence Evaluation on DB-3DME 1.0 (test)
0.483Pearson RChatGPT-5-high
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ChatGPT-5-highPrompting Version=V22026.06 | 0.483 | 64.3 | 96.4 | |
| ChatGPT-5-lowPrompting Version=V22026.06 | 0.472 | 64.5 | 95.4 | |
| ChatGPT-5-mediumPrompting Version=V22026.06 | 0.468 | 63.7 | 96.3 | |
| ChatGPT-5-highPrompting Version=V12026.06 | 0.459 | 64.9 | 95.6 | |
| Gemini-2.5-proPrompting Version=V12026.06 | 0.454 | 64.8 | 94 | |
| Gemini-2.5-proPrompting Version=V22026.06 | 0.452 | 63.6 | 94 | |
| ChatGPT-5-mediumPrompting Version=V12026.06 | 0.451 | 63.9 | 95.6 | |
| ChatGPT-5-lowPrompting Version=V12026.06 | 0.427 | 64 | 94.5 | |
| ChatGPT-4oPrompting Version=V12026.06 | 0.414 | 64.4 | 94 | |
| ChatGPT-4oPrompting Version=V22026.06 | 0.413 | 64.1 | 94.2 | |
| ChatGPT-4.1Prompting Version=V22026.06 | 0.404 | 60.2 | 94.4 | |
| ChatGPT-4.1Prompting Version=V12026.06 | 0.393 | 60.5 | 93.9 | |
| Qwen-2.5-vl-7bPrompting Version=V12026.06 | 0.232 | 50 | 87.2 | |
| CLIP Score (ViT-L/14)Type=Non-VLM baseline2026.06 | 0.228 | — | — | |
| Qwen-2.5-vl-7bPrompting Version=V22026.06 | 0.214 | 50.7 | 83.7 |