Social omnimodal reasoning on Social Omni
90Level 1 AccGemini 3.1 Pro
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gemini 3.1 Pro2026.05 | 90 | 62 | — | |
| Qwen 3.5 Omni Plus2026.05 | 88 | 40 | — | |
| Gemini 3 Flash2026.05 | 85 | 67 | — | |
| GPT-5.4 xHighHarness=Codex, Reasoning effort=xHigh2026.05 | 75 | 60 | — | |
| GPT-5.4 High§Harness=Codex, Direct image read=disabled2026.05 | 74 | 48 | — | |
| GPT-5.4 HighHarness=Codex, Reasoning effort=High2026.05 | 72 | 51 | — | |
| GPT-5.4 MediumHarness=Codex, Reasoning effort=Medium2026.05 | 71 | 49 | — | |
| Mimo V2 Omni2026.05 | 64 | 40 | — | |
| GPT-5.4 LowHarness=Codex, Reasoning effort=Low2026.05 | 64 | 59 | — | |
| Codex-GPT-5.4 LowSetting=Strong Baseline2026.05 | 64 | 59 | — | |
| Code-X (SFT)Model=Qwen3.6-27B, Thinking budget=4K2026.05 | 64 | 67 | — | |
| Qwen 3 Omni2026.05 | 61 | 39 | — | |
| Direct MLLMModel=Qwen3.6-27B, Thinking budget=4K2026.05 | 61 | 47 | — | |
| OmniAgentBackbone=GPT-5.4 High2026.05 | 55 | 56 | — | |
| Claude Opus 4.6Harness=CC2026.05 | 54 | 68 | — | |
| Code-X (RL)Model=Qwen3.5-9B, Thinking budget=4K2026.05 | 52 | 63 | — | |
| OmniAtlas-Omni-30B-A3BSetting=Strong Baseline2026.05 | 50 | 61 | — | |
| Code-X (SFT)Model=Qwen3.5-9B, Thinking budget=4K2026.05 | 50 | 61 | — | |
| Kimi K-2.5Harness=CC2026.05 | 46 | 50 | — | |
| Baseline (direct image)Model=Qwen3.6-27B, Thinking budget=4K2026.05 | 46 | 55 | — | |
| Baseline (direct image)Model=Qwen3.5-9B, Thinking budget=4K2026.05 | 41 | 58 | — | |
| Agent-OmniBackbone=GPT-5.4 High2026.05 | 37 | 48 | — | |
| Direct MLLMModel=Qwen3.5-9B, Thinking budget=4K2026.05 | 37 | 59 | — | |
| MiniMax-M2.7‡Harness=CC2026.05 | 28 | 46 | — |