Video-demo In-context Learning on Demo-ICL-Bench
80.4Accuracy (Demo)Human
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Human2026.02 | 80.4 | — | — | |
| Gemini-2.5-Pro2026.02 | 36.2 | — | — | |
| Demo-ICLSize=7B, Frame=322026.02 | 32 | 27.6 | 4.4 | |
| GPT-4o2026.02 | 31.4 | — | — | |
| LLaVA-VideoSize=7B, Frame=322026.02 | 30.2 | 29 | 1.2 | |
| Demo-ICL (SFT)Size=7B, Frame=322026.02 | 29.4 | 26.2 | 3.2 | |
| VideoChat-R1Size=7B, Frame=322026.02 | 28.2 | 26.8 | 1.4 | |
| Qwen2.5-VLSize=7B, Frame=322026.02 | 28 | 26.2 | 1.8 | |
| Video-R1Size=7B, Frame=322026.02 | 27.4 | 26.6 | 0.8 | |
| InternVL-3Size=8B, Frame=322026.02 | 27 | 26.4 | 0.6 | |
| Qwen2.5-VLSize=72B, Frame=322026.02 | 25.6 | 25.2 | 0.4 | |
| Ola-Video (Base)Size=7B, Frame=322026.02 | 25 | 26 | -1 | |
| OlaSize=7B, Frame=322026.02 | 24.6 | 26.4 | -1.8 | |
| Qwen2-VLSize=7B, Frame=322026.02 | 22.4 | 24 | -1.6 |