Long Video Understanding on EgoSchema (val)
88.2AccuracyMEMDREAMER
Evaluation Results
| Method | Links | |
|---|---|---|
| MEMDREAMERReason Model=Gemini-2.5-Pro2026.06 | 88.2 | |
| MEMDREAMERReason Model=Gemini-3.1-Pro2026.06 | 87.8 | |
| MEMDREAMERReason Model=Qwen3-VL-235B-A22B-Thinking2026.06 | 87.4 | |
| InternVL3.5Reason Model=InternVL3.5-30BA3B2026.06 | 86.8 | |
| LensWalkReasoner=o3, Observer=Qwen2.5-VL-72B2026.03 | 77.2 | |
| Deep Video Discovery2026.03 | 76.6 | |
| DVDReason Model=OpenAI-o32026.06 | 76.6 | |
| Gemini-3.1-ProReason Model=Gemini-3.1-Pro2026.06 | 76.4 | |
| VideoARMReason Model=OpenAI-o32026.06 | 76.2 | |
| Qwen3-VLReason Model=Qwen3-VL-235B-A22B-Thinking2026.06 | 75.9 | |
| Qwen2.5-VL-72B2026.03 | 75.4 | |
| LensWalkReasoner=o3, Observer=GPT-4.12026.03 | 74.8 | |
| LensWalkReasoner=o3, Observer=o32026.03 | 74.8 | |
| LLaVA-Video-72B2026.03 | 74.7 | |
| LensWalkReasoner=GPT-5, Observer=GPT-52026.03 | 74.6 | |
| GPT-52026.03 | 73.8 | |
| VCA2026.03 | 73.6 | |
| VCAReason Model=VCA2026.06 | 73.6 | |
| Qwen3.5-9BInput Modality=Frames + SG-Ego2026.07 | 73.2 | |
| MR. Video2026.03 | 73 | |
| MR. VideoReason Model=MR. Video2026.06 | 73 | |
| Gemini-2.5-ProReason Model=Gemini-2.5-Pro2026.06 | 72.8 | |
| Qwen3.5-9BInput Modality=Frames2026.07 | 72.8 | |
| GPT-4.12026.03 | 72.2 | |
| EgoThinker2026.07 | 71.8 | |
| Gemini-2.0-Flash2026.03 | 71.2 | |
| Gemini-2.0-FlashReason Model=Gemini-2.0-Flash2026.06 | 71.2 | |
| GPT-4o2026.03 | 70.4 | |
| GPT-4oReason Model=GPT-4o2026.06 | 70.4 | |
| GLM-4.6VReason Model=GLM-4.6V-106B-A12B2026.06 | 68.8 | |
| GLM-4.5VReason Model=GLM-4.5V-106B-A12B2026.06 | 68.4 | |
| Ego-R12026.03 | 68.2 | |
| VideoTreeReason Model=VideoTree2026.06 | 67 | |
| Qwen3.5-9BInput Modality=SG-Ego2026.07 | 66 | |
| o32026.03 | 63.2 | |
| VideoAgent2026.03 | 63.2 | |
| OpenAI-o3Reason Model=OpenAI-o32026.06 | 63.2 | |
| VideoAgentReason Model=VideoAgent2026.06 | 63.2 | |
| Qwen3.5-9BInput Modality=Blind2026.07 | 38.2 |