Multimodal Reasoning on MMBench
90.63AccuracyAutoNPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AutoNPO2026.04 | 90.63 | — | |
| RLEPtype=far future2026.04 | 90.45 | — | |
| ExGRPOtype=historical replay2026.04 | 90.44 | — | |
| NPOstage=early-stage only2026.04 | 90.41 | — | |
| NPOstage=early + late-stage2026.04 | 90.3 | — | |
| GRPOtype=pure on-policy2026.04 | 90.29 | — | |
| Qwen3-VL-8B-Instruct2026.04 | 89.79 | — | |
| LUFFYtype=external teacher2026.04 | 89.49 | — | |
| Sora-2 AudioInput Modality=Audio, LLM-as-a-Judge=GPT-4o2025.11 | 89 | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Strategy=LongCoT (Thinking)2026.02 | 87 | — | |
| Gemini 2.5 ProInput Modality=Multimodal, LLM-as-a-Judge=GPT-4o2025.11 | 86.9 | — | |
| GPT-5 highInput Modality=Multimodal, LLM-as-a-Judge=GPT-4o2025.11 | 84.2 | — | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2026.06 | 83.6 | — | |
| Qwen2.5Type=AR2026.05 | 83.5 | — | |
| InternVL3Type=AR2026.05 | 83.4 | — | |
| LLaDA-V + OursType=Diff.2026.05 | 83.3 | — | |
| SAPBackbone=Qwen3-VL-8B, Strategy=SAP2026.02 | 82.9 | — | |
| LLaDA-VType=Diff.2026.05 | 82.9 | — | |
| InternVL2-8B + RPRP fine-tuning=Object Replacement Data2024.08 | 82.7 | — | |
| InternVL2-8B-FTRP fine-tuning=None2024.08 | 82.5 | — | |
| Claude Sonnet 4.5Input Modality=Multimodal, LLM-as-a-Judge=GPT-4o2025.11 | 82.5 | — | |
| LLaVA-OVType=AR2026.05 | 80.8 | — | |
| Phantom-3.8BModel Size=3.8B2024.09 | 80.4 | — | |
| TroL-3.8BModel Size=3.8B2024.09 | 79.2 | — | |
| RECAPBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 78.52 | — | |
| CoresetBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 78.09 | — | |
| Reasoning-onlyBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 77.84 | — | |
| Phantom-1.8BModel Size=1.8B2024.09 | 76.6 | — | |
| TroL-1.8BModel Size=1.8B2024.09 | 76.1 | — | |
| VLAA-Thinker-7B2025.10 | 75.95 | — | |
| UniformBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 75.34 | — | |
| V-SkipBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=N=72026.06 | 74.7 | — | |
| PropMixBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 73.54 | — | |
| LwFBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 73.11 | — | |
| VTWBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=K=72026.06 | 72.8 | — | |
| ShortVBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=N=72026.06 | 72.8 | — | |
| Phantom-0.5BModel Size=0.5B2024.09 | 72.7 | — | |
| LaViDa + OursType=Diff.2026.05 | 72 | — | |
| Qwen2.5-VL-7Bvariant=Base model2025.10 | 71.82 | — | |
| CASTRatio=1%, Sampling Strategy=CAST, Backbone=Qwen2-VL-2B2026.05 | 71.74 | — | |
| LaViDaType=Diff.2026.05 | 71.7 | — | |
| OpenVLThinker-7B2025.10 | 71.53 | — | |
| CASTRatio=10%, Sampling Strategy=CAST, Backbone=Qwen2-VL-2B2026.05 | 70.86 | — | |
| RandomRatio=1%, Sampling Strategy=Random, Backbone=Qwen2-VL-2B2026.05 | 70.82 | — | |
| MM1-MoE-3B×64Model Size=3B x 642024.09 | 70.8 | — | |
| Qwen3-VL-8B-InstructBackbone=Qwen3-VL-8B, Strategy=Instruct2026.02 | 70.7 | — | |
| CASTRatio=5%, Sampling Strategy=CAST, Backbone=Qwen2-VL-2B2026.05 | 70.51 | — | |
| RandomRatio=5%, Sampling Strategy=Random, Backbone=Qwen2-VL-2B2026.05 | 70.19 | — | |
| RandomRatio=10%, Sampling Strategy=Random, Backbone=Qwen2-VL-2B2026.05 | 70.12 | — | |
| Vision-R1-7B2025.10 | 69.46 | — | |
| MGM-7BRP fine-tuning=None2024.08 | 69.3 | — | |
| V-SkipBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 69.3 | — | |
| LLaVA-NeXT-13BBase Model=LLaVA-NeXT-13B2026.06 | 69.2 | — | |
| VTWBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=K=202026.06 | 69.2 | — | |
| MiniCPM-V2-2.8BModel Size=2.8B2024.09 | 69.1 | — | |
| ShortVBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 69.1 | — | |
| VTWBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=K=202026.06 | 68.8 | — | |
| MGM-7B + RPRP fine-tuning=Object Replacement Data2024.08 | 68.7 | — | |
| LLaVA-1.5-13BBase Model=LLaVA-1.5-13B2026.06 | 68.7 | — | |
| ShortVBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=N=242026.06 | 68.7 | — | |
| V-SkipBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=N=242026.06 | 68.7 | — | |
| Bunny-3BModel Size=3B2024.09 | 68.6 | — | |
| LLaVA-1.6Type=AR2026.05 | 68.1 | — | |
| MoE-LLaVA-2.7B×4Model Size=2.7B x 42024.09 | 68 | — | |
| MM1-3BModel Size=3B2024.09 | 67.8 | — | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 67.8 | — | |
| LLaVA-v1.5-13BModel scale=13B, Number of vision tokens=5762025.08 | 67.7 | — | |
| VanillaBackbone=LLaVA-1.5-13B, Token Budget=Full Tokens2026.06 | 67.7 | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 67.6 | — | |
| VanillaVisual Token Budget=2880, Token Retention Ratio=100%2026.06 | 67.4 | — | |
| LLaVA-NeXT-7BBase Model=LLaVA-NeXT-7B2026.06 | 67.2 | — | |
| ShortVBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=N=192026.06 | 67.2 | — | |
| VTWBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=K=162026.06 | 67.1 | — | |
| Zoo-PruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 67 | — | |
| TinyLLaVA-3.1BModel Size=3.1B2024.09 | 66.9 | — | |
| TinyLLaVA-Sig-Phi-3.1BModel Size=3.1B2024.09 | 66.9 | — | |
| V-SkipBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=N=192026.06 | 66.8 | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 66.7 | — | |
| Imp-v1-3BModel Size=3B2024.09 | 66.5 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=256, Compression ratio=55.6%2025.08 | 66.4 | — | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 66.3 | — | |
| Fourier-LLaVAModel scale=13B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 66.2 | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 66.2 | — | |
| LLaVA-1.5-7B + RPRP fine-tuning=Object Replacement Data2024.08 | 66.1 | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 66.1 | — | |
| ATP-LLaVAModel scale=7B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 66 | — | |
| CoFi-DecBackbone=LLaVA-1.52025.12 | 65.9 | — | |
| PruMergeModel scale=13B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 65.7 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 65.6 | — | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 65.4 | — | |
| DeFGBackbone=LLaVA-1.52025.12 | 65.2 | — | |
| V-SkipBase Model=LLaVA-1.5-7B, Hyperparameter (K/N)=N=192026.06 | 65 | — | |
| PruMergeModel scale=7B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 64.9 | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 64.9 | — | |
| Zoo-PruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 64.8 | — | |
| ShortVBase Model=LLaVA-1.5-7B, Hyperparameter (K/N)=N=192026.06 | 64.8 | — | |
| VanillaBackbone=LLaVA-1.5-7B, Retained Tokens=576, Compression Ratio=100%2026.04 | 64.7 | — | |
| ATP-LLaVAModel scale=7B, Number of vision tokens=88, Compression ratio=88.9%2025.08 | 64.7 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=64, Compression ratio=88.9%2025.08 | 64.7 | — | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 64.7 | — |