Linguistic correctness of descriptions on XM3600
85.81Preference RateLLaVA-PLLuM-12B-nc
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-PLLuM-12B-ncJudge=Llama-3.3-70B-Instruct, Baseline model=LLaVA-1.6-Mistral-7B2026.02 | 85.81 | |
| LLaVA-PLLuM-12B-nc-250715Judge=Llama-3.3-70B-Instruct, Baseline model=LLaVA-1.6-Mistral-7B2026.02 | 84.91 | |
| LLaVA-Bielik-11B-v2.6Judge=Llama-3.3-70B-Instruct, Baseline model=LLaVA-1.6-Mistral-7B2026.02 | 82.35 | |
| LLaVA-PLLuM-12B-ncJudge=Llama-3.3-70B-Instruct, Baseline model=PaliGemma2-10B2026.02 | 77.53 | |
| LLaVA-PLLuM-12B-nc-250715Judge=Llama-3.3-70B-Instruct, Baseline model=PaliGemma2-10B2026.02 | 77.47 | |
| LLaVA-Bielik-11B-v2.6Judge=Llama-3.3-70B-Instruct, Baseline model=PaliGemma2-10B2026.02 | 74.1 | |
| LLaVA-PLLuM-12B-ncJudge=Llama-3.3-70B-Instruct, Baseline model=LLaVA-1.6-Vicuna-13B2026.02 | 66.71 | |
| LLaVA-PLLuM-12B-nc-250715Judge=Llama-3.3-70B-Instruct, Baseline model=LLaVA-1.6-Vicuna-13B2026.02 | 63.64 | |
| LLaVA-Bielik-11B-v2.6Judge=Llama-3.3-70B-Instruct, Baseline model=LLaVA-1.6-Vicuna-13B2026.02 | 60.32 | |
| LLaVA-PLLuM-12B-ncJudge=Llama-3.3-70B-Instruct, Baseline model=Pixtral-12B2026.02 | 48.33 | |
| LLaVA-PLLuM-12B-nc-250715Judge=Llama-3.3-70B-Instruct, Baseline model=Pixtral-12B2026.02 | 43.38 | |
| LLaVA-PLLuM-12B-ncJudge=Llama-3.3-70B-Instruct, Baseline model=Qwen2.5-VL-7B2026.02 | 43.15 | |
| LLaVA-PLLuM-12B-nc-250715Judge=Llama-3.3-70B-Instruct, Baseline model=Qwen2.5-VL-7B2026.02 | 42.69 | |
| LLaVA-Bielik-11B-v2.6Judge=Llama-3.3-70B-Instruct, Baseline model=Pixtral-12B2026.02 | 40.31 | |
| LLaVA-Bielik-11B-v2.6Judge=Llama-3.3-70B-Instruct, Baseline model=Qwen2.5-VL-7B2026.02 | 34.76 |