Cross-view Temporal Reasoning on EgoExo-Con V-Exo
73.1AccuracyInternVL3.5-8B + View-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL3.5-8B + View-GRPOBackbone=InternVL3.5-8B, Training Protocol=View-GRPO2025.10 | 73.1 | |
| InternVL3.5-8BBackbone=InternVL3.5-8B, Training Protocol=Base2025.10 | 64.4 | |
| InternVL3.5-8B + View-GRPOBackbone=InternVL3.5-8B, Training Protocol=View-GRPO2025.10 | 62.4 | |
| Qwen2.5-VL-7B + View-GRPOBackbone=Qwen2.5-VL-7B, Training Protocol=View-GRPO2025.10 | 58.6 | |
| Qwen2.5-VL-7B + SFTBackbone=Qwen2.5-VL-7B, Training Protocol=SFT2025.10 | 57.6 | |
| Qwen2.5-VL-7B + GRPOBackbone=Qwen2.5-VL-7B, Training Protocol=GRPO2025.10 | 55.2 | |
| Qwen2.5-VL-3B + View-GRPOBackbone=Qwen2.5-VL-3B, Training Protocol=View-GRPO2025.10 | 54.6 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Training Protocol=Base2025.10 | 54.3 | |
| Qwen2.5-VL-3B + SFTBackbone=Qwen2.5-VL-3B, Training Protocol=SFT2025.10 | 52.7 | |
| Qwen2.5-VL-3B + GRPOBackbone=Qwen2.5-VL-3B, Training Protocol=GRPO2025.10 | 52.5 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Training Protocol=Base2025.10 | 51 | |
| InternVL3.5-8BBackbone=InternVL3.5-8B, Training Protocol=Base2025.10 | 50.7 | |
| Qwen2.5-VL-7B + View-GRPOBackbone=Qwen2.5-VL-7B, Training Protocol=View-GRPO2025.10 | 45.1 | |
| Qwen2.5-VL-7B + SFTBackbone=Qwen2.5-VL-7B, Training Protocol=SFT2025.10 | 41.4 | |
| Qwen2.5-VL-7B + GRPOBackbone=Qwen2.5-VL-7B, Training Protocol=GRPO2025.10 | 39.8 | |
| Qwen2.5-VL-3B + View-GRPOBackbone=Qwen2.5-VL-3B, Training Protocol=View-GRPO2025.10 | 34.2 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Training Protocol=Base2025.10 | 33 | |
| Qwen2.5-VL-3B + SFTBackbone=Qwen2.5-VL-3B, Training Protocol=SFT2025.10 | 30.6 | |
| Qwen2.5-VL-3B + GRPOBackbone=Qwen2.5-VL-3B, Training Protocol=GRPO2025.10 | 30.3 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Training Protocol=Base2025.10 | 28.1 |