Fine-grained attribute prediction on RealQA
0.711Eye-Catch SRCCFine-tuned Qwen2-VL-7B (Ours)
Evaluation Results
| Method | Links | |||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Fine-tuned Qwen2-VL-7B (Ours)Fine-tuned=true, Backbone=Qwen2-VL-7B2025.03 | 0.711 | 0.755 | 0.825 | 0.854 | 0.493 | 0.491 | 0.552 | 0.641 | 0.38 | 0.38 | 0.405 | 0.405 | 0.64 | 0.702 | 0.535 | 0.553 | 0.752 | 0.774 | 0.588 | 0.617 | 1 | |
| GPT-4oFine-tuned=false2025.03 | 0.702 | 0.722 | 0.795 | 0.812 | 0.232 | 0.231 | 0.337 | 0.372 | 0.416 | 0.412 | 0.238 | 0.238 | 0.625 | 0.676 | 0.52 | 0.513 | 0.633 | 0.655 | 0.5 | 0.515 | 2 | |
| GPT-4o-miniFine-tuned=false2025.03 | 0.678 | 0.707 | 0.753 | 0.791 | 0.164 | 0.167 | 0.327 | 0.341 | 0.354 | 0.356 | 0.266 | 0.266 | 0.525 | 0.549 | 0.293 | 0.313 | 0.736 | 0.763 | 0.455 | 0.473 | 4 | |
| GPT-4VFine-tuned=false2025.03 | 0.656 | 0.708 | 0.713 | 0.755 | 0.212 | 0.213 | 0.362 | 0.397 | 0.363 | 0.368 | 0.319 | 0.319 | 0.5 | 0.576 | 0.282 | 0.311 | 0.585 | 0.6 | 0.444 | 0.472 | 5 | |
| Qwen-VL-MaxFine-tuned=false2025.03 | 0.648 | 0.694 | 0.701 | 0.749 | 0.231 | 0.232 | 0.461 | 0.488 | 0.381 | 0.376 | 0.273 | 0.273 | 0.581 | 0.622 | 0.348 | 0.361 | 0.683 | 0.686 | 0.479 | 0.498 | 3 | |
| Qwen2-VL-72BFine-tuned=false2025.03 | 0.633 | 0.703 | 0.615 | 0.677 | 0.263 | 0.264 | 0.455 | 0.476 | 0.123 | 0.122 | 0.248 | 0.248 | 0.587 | 0.645 | 0.336 | 0.351 | 0.652 | 0.665 | 0.435 | 0.461 | 6 | |
| Qwen2-VL-7BFine-tuned=false2025.03 | 0.627 | 0.692 | 0.616 | 0.663 | — | — | — | — | 0.269 | 0.265 | — | — | 0.444 | 0.518 | 0.171 | 0.191 | 0.507 | 0.559 | — | — | 7 |