Visual Perception and Understanding on V*Bench
37.17AccuracyLaViDa-O + RL (Global + Factorized)
Evaluation Results
| Method | Links | |
|---|---|---|
| LaViDa-O + RL (Global + Factorized)Arch=D-Diff2026.06 | 37.17 | |
| LaViDa-O + SFTArch=D-Diff2026.06 | 31.94 | |
| MMaDA-Parallel + RL (Global + Factorized)Arch=D-Diff2026.06 | 30.37 | |
| LaViDa-O + RL (LocFac-RL)Arch=D-Diff, per-step train time reduction=↓ 12.3% s/step2026.06 | 29.32 | |
| MMaDA-Parallel + RL (LocFac-RL)Arch=D-Diff, per-step train time reduction=↓ 16.9% s/step2026.06 | 28.27 | |
| MMaDA-Parallel + SFTArch=D-Diff2026.06 | 26.7 | |
| ANOLE + RLArch=AR2026.06 | 20.9 | |
| LaViDa-OArch=D-Diff2026.06 | 19.9 | |
| ANOLE + SFTArch=AR2026.06 | 18.3 | |
| ANOLEArch=AR2026.06 | 7.3 | |
| MMaDA-ParallelArch=D-Diff2026.06 | 0 |