Model-Specific Preference Bias Evaluation on SelfEval-Cap
3.03Phi-scoreInternVL2.5-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2.5-8BEvaluation Framework=G-VEval2026.04 | 3.03 | |
| PommsEvaluation Framework=Pomms, Ensemble Composition=(i) GPT-4o and InternVL2.5-8B2026.04 | 1.31 | |
| Qwen2.5-VL-7BEvaluation Framework=G-VEval2026.04 | 1.12 | |
| GPT-4oEvaluation Framework=G-VEval2026.04 | 1.08 | |
| PommsEvaluation Framework=Pomms, Ensemble Composition=(v) + Qwen2.5-VL-7B2026.04 | 0.52 | |
| PommsEvaluation Framework=Pomms, Ensemble Composition=(ii) + Eagle2-9B2026.04 | 0.45 | |
| PommsEvaluation Framework=Pomms, Ensemble Composition=(vi) + Phi-3.5-Vision2026.04 | 0.42 | |
| PommsEvaluation Framework=Pomms, Ensemble Composition=(iv) + DeepSeek-VL22026.04 | 0.15 | |
| PommsEvaluation Framework=Pomms, Ensemble Composition=(iii) + LLaVA-OneVision-7B2026.04 | -0.19 |