Video Understanding on EgoSchema
69.4EgoSchema ScoreFLoC
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| FLoCModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 69.4 | — | — | — | — | — | — | |
| LongVUModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 69.2 | — | — | — | — | — | — | |
| DyCokeModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 69 | — | — | — | — | — | — | |
| TS-LLaVAModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 68.2 | — | — | — | — | — | — | |
| DyCokeModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 67.4 | — | — | — | — | — | — | |
| RandomModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 66.6 | — | — | — | — | — | — | |
| STTMModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 66.2 | — | — | — | — | — | — | |
| FLoCModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 66.2 | — | — | — | — | — | — | |
| ScissorModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 65.8 | — | — | — | — | — | — | |
| RandomModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 65.2 | — | — | — | — | — | — | |
| DivPruneModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 65 | — | — | — | — | — | — | |
| FLoCModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 63.8 | — | — | — | — | — | — | |
| STTMModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 63.4 | — | — | — | — | — | — | |
| ScissorModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 63.4 | — | — | — | — | — | — | |
| Qwen3-VL-8BTraining Stages=PT, Decoding Mode=direct answer2025.12 | 63.1 | — | — | — | — | — | — | |
| DyCokeModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 63 | — | — | — | — | — | — | |
| Qwen3-VL-8BTraining Stages=PT, Decoding Mode=concise reason2025.12 | 62.8 | — | — | — | — | — | — | |
| PruneVidModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 62.8 | — | — | — | — | — | — | |
| TS-LLaVAModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 62.8 | — | — | — | — | — | — | |
| ScissorModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 62.6 | — | — | — | — | — | — | |
| LLaVA-OneVision-7BToken Budget=100%2026.04 | 62.4 | — | — | — | — | — | — | |
| IWPToken Budget=11.1%2026.04 | 62.2 | — | — | — | — | — | — | |
| DivPruneModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 61.8 | — | — | — | — | — | — | |
| HoliTomRetention Ratio=15%/7.5%2026.03 | 61.2 | — | — | — | — | — | — | |
| HoliTomRetention Ratio=10%/5%2026.03 | 61.2 | — | — | — | — | — | — | |
| TS-LLaVAModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 61 | — | — | — | — | — | — | |
| PACTToken Budget=11.1%2026.04 | 61 | — | — | — | — | — | — | |
| STTMModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 60.8 | — | — | — | — | — | — | |
| OursRetention Ratio=10%/5%2026.03 | 60.6 | — | — | — | — | — | — | |
| OursRetention Ratio=15%/7.5%2026.03 | 60.5 | — | — | — | — | — | — | |
| Ours (w/o M)Retention Ratio=10%2026.03 | 60.5 | — | — | — | — | — | — | |
| HoliTomRetention Ratio=5%/2.5%2026.03 | 60.5 | — | — | — | — | — | — | |
| LongVUModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 60.4 | — | — | — | — | — | — | |
| RandomModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 60.4 | — | — | — | — | — | — | |
| LLaVA-OV-7BRetention Ratio=100%2026.03 | 60.4 | — | — | — | — | — | — | |
| OursRetention Ratio=5%/2.5%2026.03 | 60.2 | — | — | — | — | — | — | |
| FLoCModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 60 | — | — | — | — | — | — | |
| VisionZipRetention Ratio=15%2026.03 | 59.8 | — | — | — | — | — | — | |
| TS-LLaVAModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 59.6 | — | — | — | — | — | — | |
| DyCokeModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 59.6 | — | — | — | — | — | — | |
| DyToKRetention Ratio=15%2026.03 | 59.5 | — | — | — | — | — | — | |
| Ours (w/o M)Retention Ratio=5%2026.03 | 59.5 | — | — | — | — | — | — | |
| LongVUModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 59.4 | — | — | — | — | — | — | |
| DivPruneModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 59.4 | — | — | — | — | — | — | |
| LLaVA-VideoRelative token budget=100%, Prefilling FLOPs (T)=80.2, FLOPs Ratio=100%2026.04 | 59.4 | — | — | — | — | — | — | |
| HieraVidRelative token budget=30%, Prefilling FLOPs (T)=19.6, FLOPs Ratio=24.5%2026.04 | 59.2 | — | — | — | — | — | — | |
| LongVUModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 58.8 | — | — | — | — | — | — | |
| FastVIDRetention Ratio=15%2026.03 | 58.8 | — | — | — | — | — | — | |
| DivPruneToken Budget=11.1%2026.04 | 58.8 | — | — | — | — | — | — | |
| FastVIDRetention Ratio=10%2026.03 | 58.7 | — | — | — | — | — | — | |
| RandomModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 58.6 | — | — | — | — | — | — | |
| FastVIDModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 58.6 | — | — | — | — | — | — | |
| Video-CCAMSize=9B2024.12 | 58.5 | — | — | — | — | — | — | |
| DivPruneModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 58.4 | — | — | — | — | — | — | |
| PruneVidModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 58.4 | — | — | — | — | — | — | |
| DyToKRetention Ratio=10%2026.03 | 58.4 | — | — | — | — | — | — | |
| RandomModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 58.2 | — | — | — | — | — | — | |
| FastVToken Budget=11.1%2026.04 | 58.2 | — | — | — | — | — | — | |
| FLoCModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 58 | — | — | — | — | — | — | |
| VisionZipRetention Ratio=10%2026.03 | 58 | — | — | — | — | — | — | |
| OursRetention Ratio=2%/1%2026.03 | 57.6 | — | — | — | — | — | — | |
| LLaVA-ScissorRetention Ratio=10%2026.03 | 57.5 | — | — | — | — | — | — | |
| VanillaRetention Ratio R=100%2026.02 | 57.3 | — | 59.4 | — | — | — | — | |
| LLaVA-Video-7BPrefilling FLOPs (T)=80.2, FLOPs Ratio=100%, Before LLM Retained Ratio=100%2026.03 | 57.2 | — | — | — | 60.2 | 100 | — | |
| TS-LLaVAModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 57.2 | — | — | — | — | — | — | |
| FastVIDModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 57.2 | — | — | — | — | — | — | |
| HoliTomRetention Ratio=2%/1%2026.03 | 57.2 | — | — | — | — | — | — | |
| Ours (w/o M)Retention Ratio=2%2026.03 | 57.2 | — | — | — | — | — | — | |
| FastVIDRetention Ratio=5%2026.03 | 57.1 | — | — | — | — | — | — | |
| VisionZipRetention Ratio R=25%2026.02 | 57 | — | 59 | — | — | — | — | |
| Framefusion (ICCV2025)Relative token budget=30%, Prefilling FLOPs (T)=19.1, FLOPs Ratio=23.8%2026.04 | 56.8 | — | — | — | — | — | — | |
| HieraVidRelative token budget=20%, Prefilling FLOPs (T)=13.8, FLOPs Ratio=17.2%2026.04 | 56.8 | — | — | — | — | — | — | |
| Full ModelSparsity Ratio=0%, Base Model=LLaVA-OneVision2025.04 | 56.7 | — | — | — | — | — | — | |
| Full ModelBackbone=LLaVA-OneVision, Sparsity Ratio=0%2026.04 | 56.7 | — | — | — | — | — | — | |
| FlashVIDRetention Ratio R=25%2026.02 | 56.6 | — | 59.2 | — | — | — | — | |
| LLaVA-ScissorRetention Ratio=5%2026.03 | 56.6 | — | — | — | — | — | — | |
| Video-CCAMSize=4B2024.12 | 56.5 | — | — | — | — | — | — | |
| ScissorModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 56.4 | — | — | — | — | — | — | |
| LongVASize=7B2024.12 | 56.3 | — | — | — | — | — | — | |
| PruneVid (ACL2025)Relative token budget=30%, Prefilling FLOPs (T)=19.1, FLOPs Ratio=23.8%2026.04 | 56.2 | — | — | — | — | — | — | |
| FsatVRetention Ratio=100%/10%2026.03 | 55.9 | — | — | — | — | — | — | |
| FlashVIDRetention Ratio R=15%2026.02 | 55.8 | — | 57.8 | — | — | — | — | |
| STTMModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 55.8 | — | — | — | — | — | — | |
| DivPruneModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 55.8 | — | — | — | — | — | — | |
| VisionZipRetention Ratio R=15%2026.02 | 55.7 | — | 58.6 | — | — | — | — | |
| PruMerge (ICCV2025)Relative token budget=30%, Prefilling FLOPs (T)=19.1, FLOPs Ratio=23.8%2026.04 | 55.7 | — | — | — | — | — | — | |
| AOTPrefilling FLOPs (T)=9.3, FLOPs Ratio=18.9%, Before LLM Retained Ratio=25%2026.03 | 55.6 | — | — | — | 58.3 | 96.8 | — | |
| FastVIDRetention Ratio R=25%2026.02 | 55.4 | — | 57.4 | — | — | — | — | |
| LongVUModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 55.4 | — | — | — | — | — | — | |
| TopoVLMBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 55.4 | — | — | — | — | — | — | |
| SparseGPTSparsity Ratio=60%, Base Model=LLaVA-OneVision2025.04 | 55.1 | — | — | — | — | — | — | |
| FastV (ECCV2024)Relative token budget=30%, Prefilling FLOPs (T)=23.5, FLOPs Ratio=39.3%2026.04 | 55.1 | — | — | — | — | — | — | |
| PruneVid (ACL2025)Relative token budget=20%, Prefilling FLOPs (T)=12.3, FLOPs Ratio=15.5%2026.04 | 55.1 | — | — | — | — | — | — | |
| SparseGPTBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 55.1 | — | — | — | — | — | — | |
| Our Final ModelTraining Stages=PT, RL, Decoding Mode=concise reason2025.12 | 55 | — | — | — | — | — | — | |
| FastVIDModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 55 | — | — | — | — | — | — | |
| FastVRetention Ratio R=25%2026.02 | 54.8 | — | 56 | — | — | — | — | |
| AOTPrefilling FLOPs (T)=9.3, FLOPs Ratio=11.6%, Before LLM Retained Ratio=15%2026.03 | 54.8 | — | — | — | 57.3 | 95.1 | — | |
| VideoChat-OnlineSize=4B2024.12 | 54.7 | — | — | — | — | — | — | |
| VisionZipPrefilling FLOPs (T)=9.3, FLOPs Ratio=18.9%, Before LLM Retained Ratio=25%2026.03 | 54.7 | — | — | — | 56.7 | 94.2 | — |