Video Reconstruction on SSv2 10K clips (test)
0.462Lag-1Temporal+M SAE (Coherence-optimized)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Temporal+M SAE (Coherence-optimized)Backbone=DINOv2, Training Scale=10K clips, tau=0.2, optimization=Coherence-optimized2026.04 | 0.462 | 0.281 | 0.321 | |
| Raw DINOv2Backbone=DINOv22026.04 | 0.435 | — | — | |
| Temporal+M SAEBackbone=DINOv2, Training Scale=10K clips2026.04 | 0.36 | 0.334 | 0.334 | |
| Separate+M SAEBackbone=DINOv2, Training Scale=10K clips2026.04 | 0.358 | 0.31 | 0.326 | |
| Raster SAEBackbone=DINOv2, Training Scale=10K clips2026.04 | 0.306 | 0.418 | 0.375 | |
| Temporal SAEBackbone=DINOv2, Training Scale=10K clips2026.04 | 0.299 | 0.32 | 0.337 | |
| Separate SAEBackbone=DINOv2, Training Scale=10K clips2026.04 | 0.29 | 0.318 | 0.333 | |
| Standard SAEBackbone=DINOv2, Training Scale=10K clips2026.04 | 0.277 | 0.454 | 0.359 |