MM 2D Grounding on CountBenchQA
93.8ScoreQwen3-VL-32B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-32BDecoding Mode=Instruct, Model Scale=32B2026.06 | 93.8 | |
| K2.5Parameter Count=≈1T2026.06 | 93.8 | |
| Yuvion VL-32BDecoding Mode=Instruct, Model Scale=32B2026.06 | 93 | |
| Qwen3.5-PlusParameter Count=397B2026.06 | 92.8 | |
| Qwen3-VL-32BDecoding Mode=Thinking, Model Scale=32B2026.06 | 92.2 | |
| Qwen3-VL-8BDecoding Mode=Instruct, Model Scale=8B2026.06 | 90.8 | |
| Yuvion VL-8BDecoding Mode=Instruct, Model Scale=8B2026.06 | 89.9 | |
| Yuvion VL-32BDecoding Mode=Reasoning, Model Scale=32B2026.06 | 89.5 | |
| Opus-4.6Parameter Count=≈800B2026.06 | 88.7 | |
| Yuvion VL-8BDecoding Mode=Reasoning, Model Scale=8B2026.06 | 88.3 | |
| GPT-5.4Parameter Count=≈1.5T2026.06 | 88.3 | |
| Qwen3-VL-8BFine-tuning setting=Base2026.07 | 86.97 | |
| Qwen3-VL-8BDecoding Mode=Thinking, Model Scale=8B2026.06 | 86.9 | |
| Qwen3-VL-8BFine-tuning setting=CPO2026.07 | 85.74 | |
| BaseFine-tuning setting=Base, Backbone=Qwen3-VL-2B2026.07 | 83.3 | |
| BaseModel=Qwen3-VL-4B2026.07 | 82.89 | |
| LoRAModel=Qwen3-VL-4B2026.07 | 80.24 | |
| Qwen3-VL-8BFine-tuning setting=GSPO2026.07 | 79.63 | |
| GSPOModel=Qwen3-VL-4B2026.07 | 76.17 | |
| LoRAFine-tuning setting=LoRA, Backbone=Qwen3-VL-2B2026.07 | 71.28 | |
| Qwen3-VL-8BFine-tuning setting=LoRA2026.07 | 70.67 | |
| GRPOModel=Qwen3-VL-4B2026.07 | 70.26 | |
| CPOModel=Qwen3-VL-4B2026.07 | 68.64 | |
| CPOFine-tuning setting=CPO, Backbone=Qwen3-VL-2B2026.07 | 65.99 | |
| Qwen3-VL-8BFine-tuning setting=GRPO2026.07 | 64.15 | |
| Qwen3-VL-8BFine-tuning setting=FFT2026.07 | 63.14 | |
| FFTFine-tuning setting=FFT, Backbone=Qwen3-VL-2B2026.07 | 62.32 | |
| FFTModel=Qwen3-VL-4B2026.07 | 61.3 | |
| GSPOFine-tuning setting=GSPO, Backbone=Qwen3-VL-2B2026.07 | 60.08 | |
| GRPOFine-tuning setting=GRPO, Backbone=Qwen3-VL-2B2026.07 | 37.88 |