Long video multimodal reasoning on LVOmniBench
80.1Easy ScoreGemini 3.1 Pro
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Gemini 3.1 Pro2026.05 | 80.1 | 71.8 | 48 | 69 | |
| Gemini 3 Flash2026.05 | 72.2 | 64.1 | 32 | 59 | |
| GPT-5.4 MediumHarness=Codex, Reasoning effort=Medium2026.05 | 72.2 | 43.6 | 40 | 53 | |
| GPT-5.4 xHighHarness=Codex, Reasoning effort=xHigh2026.05 | 66.7 | 64.1 | 32 | 57 | |
| GPT-5.4 HighHarness=Codex, Reasoning effort=High2026.05 | 66.6 | 59 | 44 | 58 | |
| Qwen 3.5 Omni Plus2026.05 | 58.3 | 35.9 | 44 | 46 | |
| GPT-5.4 LowHarness=Codex, Reasoning effort=Low2026.05 | 58.3 | 46.2 | 36 | 48 | |
| Agent-OmniBackbone=GPT-5.4 High2026.05 | 56 | 28 | 20 | 36 | |
| Kimi K-2.5Harness=CC2026.05 | 55.6 | 28 | 41 | 43 | |
| GPT-5.4 High§Harness=Codex, Direct image read=disabled2026.05 | 52.8 | 38.5 | 28 | 41 | |
| Mimo V2 Omni2026.05 | 51.4 | 25.2 | 24 | 35 | |
| MiniMax-M2.7‡Harness=CC2026.05 | 50 | 15.4 | 24 | 30 | |
| OmniAgentBackbone=GPT-5.4 High2026.05 | 50 | 21 | 28 | 33 | |
| Claude Opus 4.6Harness=CC2026.05 | 47.2 | 41 | 28 | 40 | |
| Qwen 3 Omni2026.05 | 30.6 | 17.9 | 28 | 25 |