QA-based perception on LVOmniBench
75Easy Pass@1 ScoreCode-X (SFT)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Code-X (SFT)Model=Qwen3.6-27B, Thinking budget=4K2026.05 | 75 | 53.8 | 48 | 60 | |
| Code-X (RL)Model=Qwen3.5-9B, Thinking budget=4K2026.05 | 72.2 | 41 | 44 | 53 | |
| Direct MLLMModel=Qwen3.6-27B, Thinking budget=4K2026.05 | 66.7 | 46.2 | 36 | 51 | |
| Codex-GPT-5.4 LowSetting=Strong Baseline2026.05 | 58.3 | 46.2 | 36 | 48 | |
| Baseline (direct image)Model=Qwen3.6-27B, Thinking budget=4K2026.05 | 52.8 | 33.3 | 32 | 40 | |
| Code-X (SFT)Model=Qwen3.5-9B, Thinking budget=4K2026.05 | 48.6 | 28.9 | 16 | 33 | |
| OmniAtlas-Omni-30B-A3BSetting=Strong Baseline2026.05 | 44.4 | 23.1 | 36 | 34 | |
| Direct MLLMModel=Qwen3.5-9B, Thinking budget=4K2026.05 | 44.4 | 33.3 | 16 | 33 | |
| Baseline (direct image)Model=Qwen3.5-9B, Thinking budget=4K2026.05 | 41.7 | 15.4 | 36 | 30 |