Video Reasoning on Video-Holmes
46.7ScoreGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5Size=-, # Frames=-2026.01 | 46.7 | |
| Qwen2.5-OmniRL Method=AVATAR2025.08 | 45.1 | |
| Gemini-2.5-ProSize=-, # Frames=-2026.01 | 45 | |
| Omni-R12025.08 | 44.2 | |
| Qwen2.5-OmniRL Method=GRPO2025.08 | 43.2 | |
| Video-KTRSize=7B, # Frames=642026.01 | 42.7 | |
| Echolnk2025.08 | 42.5 | |
| Ola-7BRL Method=AVATAR2025.08 | 42.4 | |
| GPT-4oSize=-, # Frames=-2026.01 | 42 | |
| Video-KTRSize=7B, # Frames=322026.01 | 41.6 | |
| Our Final ModelTraining Stages=PT, RL, Decoding Mode=concise reason2025.12 | 41.6 | |
| Gemini-1.5-ProSize=-, # Frames=-2026.01 | 41.3 | |
| Ola-7BRL Method=GRPO2025.08 | 41.3 | |
| Video-R12025.08 | 41 | |
| Video-RTSSize=7B, # Frames=51.22026.01 | 40.7 | |
| Video-KTRSize=7B, # Frames=162026.01 | 40.7 | |
| Qwen3-VL-8BTraining Stages=PT, Decoding Mode=direct answer2025.12 | 40.7 | |
| Qwen2.5-OmniRL Method=Baseline2025.08 | 40.6 | |
| VideoRFT2025.08 | 40.5 | |
| Ola-7BRL Method=Baseline2025.08 | 40.1 | |
| HumanOmni2025.08 | 39.6 | |
| AV-Reasoner2025.08 | 39.6 | |
| Video-R1-7BTraining Stages=PT, SFT, RL, Decoding Mode=chain-of-thought2025.12 | 39.4 | |
| TW-GRPO2025.08 | 38.4 | |
| Qwen2.5-VL2025.08 | 38 | |
| Qwen3-VL-8BTraining Stages=PT, Decoding Mode=concise reason2025.12 | 37.4 | |
| Video-R1Size=7B, # Frames=322026.01 | 36.5 | |
| Qwen2.5-VL-7BTraining Stages=PT, Decoding Mode=direct answer2025.12 | 35.7 | |
| Qwen2.5-VL-SFTSize=7B, # Frames=322026.01 | 33.9 | |
| Qwen2.5-VL-SFTSize=7B, # Frames=642026.01 | 33.7 | |
| TW-GRPOSize=7B, # Frames=162026.01 | 32.9 | |
| Qwen2.5-VL-7BTraining Stages=PT, Decoding Mode=concise reason2025.12 | 32.1 | |
| Qwen2.5-VL-SFTSize=7B, # Frames=162026.01 | 31.7 | |
| Qwen2.5-VLSize=7B, # Frames=-2026.01 | 27.8 |