Editing Alignment Assessment on HPE-Bench 1.0 (test)
0.8591SRCCLayer-Selective MLLM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Layer-Selective MLLMcategory=Our Framework2026.01 | 0.8591 | 0.7243 | 0.8714 | |
| Qwen3-VL (8B)category=LMM-Based Models, fine-tuned=true2026.01 | 0.8479 | 0.6785 | 0.8481 | |
| LLaVA-NeXT (8B)category=LMM-Based Models, fine-tuned=true2026.01 | 0.8437 | 0.6546 | 0.8436 | |
| DeepSeekVL2 (small)category=LMM-Based Models, fine-tuned=true2026.01 | 0.8361 | 0.6879 | 0.8322 | |
| AHIQcategory=Deep Learning-based FR IQA, reference_type=FR, fine-tuned=true2026.01 | 0.5328 | 0.3928 | 0.5827 | |
| Qwen3-VL (7B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.485 | 0.3549 | 0.4883 | |
| Q-Aligncategory=Deep Learning-based NR IQA, reference_type=NR, fine-tuned=true2026.01 | 0.4518 | 0.3717 | 0.5415 | |
| CVRKDcategory=Deep Learning-based FR IQA, reference_type=FR, fine-tuned=true2026.01 | 0.4403 | 0.3072 | 0.5194 | |
| PickScorecategory=Vision-Language Methods2026.01 | 0.3602 | 0.2346 | 0.3416 | |
| mPLUG-Owl3 (7B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.3437 | 0.2406 | 0.0357 | |
| TOPIQcategory=Deep Learning-based NR IQA, reference_type=NR, fine-tuned=true2026.01 | 0.3354 | 0.317 | 0.3552 | |
| MANIQAcategory=Deep Learning-based NR IQA, reference_type=NR, fine-tuned=true2026.01 | 0.3132 | 0.2584 | 0.3979 | |
| ImageRewardcategory=Vision-Language Methods2026.01 | 0.3079 | 0.2101 | 0.2904 | |
| DBCNNcategory=Deep Learning-based NR IQA, reference_type=NR, fine-tuned=true2026.01 | 0.2959 | 0.2221 | 0.3584 | |
| LLaVAScorecategory=Vision-Language Methods2026.01 | 0.2659 | 0.1832 | 0.2716 | |
| VQAScorecategory=Vision-Language Methods2026.01 | 0.2587 | 0.1819 | 0.2822 | |
| HyperIQAcategory=Deep Learning-based NR IQA, reference_type=NR, fine-tuned=true2026.01 | 0.2493 | 0.143 | 0.2348 | |
| FSIMcategory=Traditional FR IQA, reference_type=FR2026.01 | 0.2347 | 0.1364 | 0.2607 | |
| LLaVA-1.5 (7B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.2317 | 0.1899 | 0.2391 | |
| MSEcategory=Traditional FR IQA, reference_type=FR2026.01 | 0.2264 | 0.1528 | 0.006 | |
| PSNRcategory=Traditional FR IQA, reference_type=FR2026.01 | 0.2156 | 0.1555 | 0.2609 | |
| CLIPScorecategory=Vision-Language Methods2026.01 | 0.2099 | 0.1328 | 0.2355 | |
| LPIPScategory=Deep Learning-based FR IQA, reference_type=FR2026.01 | 0.2066 | 0.1408 | 0.277 | |
| ST-LPIPScategory=Deep Learning-based FR IQA, reference_type=FR2026.01 | 0.1961 | 0.1293 | 0.1382 | |
| InternVL3 (8B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.1739 | 0.1618 | 0.2445 | |
| SSIMcategory=Traditional FR IQA, reference_type=FR2026.01 | 0.1655 | 0.1093 | 0.2206 | |
| LLama3.2-Vision (11B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.1506 | 0.1213 | 0.0288 | |
| BRISQUEcategory=Traditional NR IQA, reference_type=NR2026.01 | 0.1386 | 0.0941 | 0.1497 | |
| BIQIcategory=Traditional NR IQA, reference_type=NR2026.01 | 0.118 | 0.071 | 0.1656 | |
| DeepSeekVL2 (small)category=LMM-Based Models, fine-tuned=false2026.01 | 0.0937 | 0.0769 | 0.0755 | |
| MiniCPM-V2.6 (8B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.071 | 0.0565 | 0.2816 | |
| DIIVINEcategory=Traditional NR IQA, reference_type=NR2026.01 | 0.0515 | 0.031 | 0.1303 | |
| LLaVA-NeXT (8B)category=LMM-Based Models, fine-tuned=false2026.01 | 0.0089 | 0.0071 | 0.0732 |