Fine-grained Perception on HRBench 4K
86.8Pass@1Kimi K2.5 + ETCHR
Evaluation Results
| Method | Links | |
|---|---|---|
| Kimi K2.5 + ETCHRTemperature=02026.05 | 86.8 | |
| Kimi K2.5Temperature=02026.05 | 85.6 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=32B2026.05 | 85.3 | |
| SFT + AXPOBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 83.3 | |
| Gemini-3.1-Flash-Lite + ETCHRTemperature=02026.05 | 82.9 | |
| Gemini-3.1-Flash-LiteTemperature=02026.05 | 81.5 | |
| SFT + AXPOBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 80.9 | |
| Qwen3-VL-8B + ETCHRTemperature=02026.05 | 80.6 | |
| SFTBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 79.5 | |
| SFTBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 79.5 | |
| SFT + GRPOBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 79.5 | |
| SFT + GRPOBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 78.8 | |
| Qwen3-VL-8BTemperature=02026.05 | 78.1 | |
| DeepEyesV2Temperature=0, Max tool invocations=102026.05 | 77.9 | |
| SFT + AXPOBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 77.9 | |
| ThymeTemperature=0, Max tool invocations=102026.05 | 77.1 | |
| GRPOBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 77.1 | |
| GRPOBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 75.5 | |
| SFT + GRPOBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 74.3 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 73.6 | |
| SFTBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 73.1 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 72.8 | |
| GRPOBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 65 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 64.6 | |
| ThinkMorph-7BTemperature=0, Max image generations=102026.05 | 59.6 | |
| Bagel-Zebra-CoTTemperature=0, Max image generations=102026.05 | 51.9 |