Social Reasoning on MMSI
71.2STIQwen3.5-9B + SGR
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen3.5-9B + SGRTraining Type=Socially-Grounded RL, Backbone=Qwen3.5-9B2026.05 | 71.2 | 66.9 | 49.2 | 62.1 | |
| Qwen3-VL-8B-ThinkingTraining Type=RL Post-Training, Backbone=Qwen3-VL-8B, Mode=Thinking2026.05 | 70.4 | 57 | 48.8 | 59 | |
| Qwen3.5-9B (Thinking Mode)Training Type=RL Post-Training, Backbone=Qwen3.5-9B, Mode=Thinking Mode2026.05 | 70.2 | 61.9 | 48.2 | 60 | |
| Qwen3.5-9B (Instruct Mode)Training Type=Supervised Fine-Tuned, Backbone=Qwen3.5-9B, Mode=Instruct Mode2026.05 | 67.9 | 68.2 | 50.1 | 61.6 | |
| Qwen3-VL-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=Qwen3-VL-8B2026.05 | 67.5 | 63.6 | 48.7 | 59.7 | |
| Qwen3-VL-8B + SGRTraining Type=Socially-Grounded RL, Backbone=Qwen3-VL-8B2026.05 | 67.4 | 63.6 | 49.8 | 60.1 | |
| LLaVA-OV-1.5-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=LLaVA-OV-1.5-8B2026.05 | 64.9 | 65.8 | 50.9 | 60.2 | |
| LLaVA-OV-1.5-8B-RLTraining Type=RL Post-Training, Backbone=LLaVA-OV-1.5-8B2026.05 | 63.3 | 59.8 | 44.1 | 55.5 | |
| VL-Rethinker-7BTraining Type=RL Post-Training, Backbone=VL-Rethinker-7B2026.05 | 62.1 | 62.7 | 47.1 | 56.9 | |
| VideoChat-R1.5-7BTraining Type=RL Post-Training, Backbone=VideoChat-R1.5-7B2026.05 | 60.4 | 65.8 | 46.9 | 57.1 | |
| Video-R1-7BTraining Type=RL Post-Training, Backbone=Video-R1-7B2026.05 | 58.6 | 60.8 | 48.8 | 55.7 | |
| Qwen2.5-VL-7B-InstructTraining Type=Supervised Fine-Tuned, Backbone=Qwen2.5-VL-7B2026.05 | 57.4 | 64.1 | 52.3 | 57.4 | |
| InternVL3.5-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=InternVL3.5-8B2026.05 | 51.5 | 58.3 | 50.3 | 53 | |
| LongVILA-R1-7BTraining Type=RL Post-Training, Backbone=LongVILA-R1-7B2026.05 | 50.5 | 44.6 | 30.5 | 41.7 | |
| InternVL3.5-8BTraining Type=RL Post-Training, Backbone=InternVL3.5-8B2026.05 | 49.2 | 42.7 | 37.5 | 43.2 |