Social Reasoning on TVQA+
73.2AccuracyQwen3-VL-8B + SGR
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-8B + SGRTraining Type=Socially-Grounded RL, Backbone=Qwen3-VL-8B2026.05 | 73.2 | |
| LLaVA-OV-1.5-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=LLaVA-OV-1.5-8B2026.05 | 72.5 | |
| Qwen3-VL-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=Qwen3-VL-8B2026.05 | 71.9 | |
| Video-R1-7BTraining Type=RL Post-Training, Backbone=Video-R1-7B2026.05 | 71.2 | |
| InternVL3.5-8BTraining Type=RL Post-Training, Backbone=InternVL3.5-8B2026.05 | 70.9 | |
| Qwen3.5-9B + SGRTraining Type=Socially-Grounded RL, Backbone=Qwen3.5-9B2026.05 | 70.9 | |
| Qwen3.5-9B (Instruct Mode)Training Type=Supervised Fine-Tuned, Backbone=Qwen3.5-9B, Mode=Instruct Mode2026.05 | 70.6 | |
| Qwen2.5-VL-7B-InstructTraining Type=Supervised Fine-Tuned, Backbone=Qwen2.5-VL-7B2026.05 | 70.4 | |
| Qwen3-VL-8B-ThinkingTraining Type=RL Post-Training, Backbone=Qwen3-VL-8B, Mode=Thinking2026.05 | 70 | |
| VideoChat-R1.5-7BTraining Type=RL Post-Training, Backbone=VideoChat-R1.5-7B2026.05 | 69.9 | |
| LLaVA-OV-1.5-8B-RLTraining Type=RL Post-Training, Backbone=LLaVA-OV-1.5-8B2026.05 | 68.4 | |
| InternVL3.5-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=InternVL3.5-8B2026.05 | 67.1 | |
| VL-Rethinker-7BTraining Type=RL Post-Training, Backbone=VL-Rethinker-7B2026.05 | 66.8 | |
| Qwen3.5-9B (Thinking Mode)Training Type=RL Post-Training, Backbone=Qwen3.5-9B, Mode=Thinking Mode2026.05 | 65.6 | |
| LongVILA-R1-7BTraining Type=RL Post-Training, Backbone=LongVILA-R1-7B2026.05 | 59.4 |