User Preference & Fluency on LLaVA-W
67.1ScoreScaled base VLM 7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Scaled base VLM 7BTrain Data=3.6M2026.06 | 67.1 | |
| Scaled base VLM 7B + MERIT (Proposed, 2D)Train Data=3.6M + 1.6M2026.06 | 66.2 | |
| LLaVA-1.5-13BTrain Data=0.7M2026.06 | 66.1 | |
| LLaVA-1.5-7BTrain Data=0.7M2026.06 | 59.6 | |
| Base VLM 7B + MERIT (Proposed, 2D)Train Data=0.7M + 1.6M2026.06 | 59.2 | |
| Base VLM 7B + Joint FFTTrain Data=0.7M + 1.6M2026.06 | 58.8 | |
| LLaVA-7BTrain Data=0.6M2026.06 | 57.2 | |
| Base VLM 7BTrain Data=0.7M2026.06 | 57.2 | |
| Scaled base VLM 7B + Joint FFTTrain Data=3.6M + 1.6M2026.06 | 50.2 | |
| LLaVA-1.5-13B + Joint FFTTrain Data=0.7M + 0.2M2026.06 | 38.5 |