Social Reasoning on Online-MMSI
63.1STIQwen3.5-9B (Thinking Mode)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen3.5-9B (Thinking Mode)Training Type=RL Post-Training, Backbone=Qwen3.5-9B, Mode=Thinking Mode2026.05 | 63.1 | 61.4 | 39.7 | 54.3 | |
| Qwen3-VL-8B-ThinkingTraining Type=RL Post-Training, Backbone=Qwen3-VL-8B, Mode=Thinking2026.05 | 62 | 60.8 | 42.5 | 54.7 | |
| Qwen3-VL-8B + SGRTraining Type=Socially-Grounded RL, Backbone=Qwen3-VL-8B2026.05 | 60.6 | 63.9 | 45.1 | 56 | |
| Qwen3.5-9B + SGRTraining Type=Socially-Grounded RL, Backbone=Qwen3.5-9B2026.05 | 60.3 | 70.4 | 42.8 | 56.9 | |
| Qwen3-VL-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=Qwen3-VL-8B2026.05 | 59.3 | 66.6 | 43.9 | 55.9 | |
| VideoChat-R1.5-7BTraining Type=RL Post-Training, Backbone=VideoChat-R1.5-7B2026.05 | 56.9 | 68.3 | 38.5 | 53.5 | |
| Qwen3.5-9B (Instruct Mode)Training Type=Supervised Fine-Tuned, Backbone=Qwen3.5-9B, Mode=Instruct Mode2026.05 | 56.6 | 68 | 43.6 | 55.2 | |
| VL-Rethinker-7BTraining Type=RL Post-Training, Backbone=VL-Rethinker-7B2026.05 | 56.3 | 64.1 | 41.8 | 53.3 | |
| LLaVA-OV-1.5-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=LLaVA-OV-1.5-8B2026.05 | 55.8 | 63.3 | 41.1 | 52.7 | |
| Qwen2.5-VL-7B-InstructTraining Type=Supervised Fine-Tuned, Backbone=Qwen2.5-VL-7B2026.05 | 55.2 | 65.5 | 42.8 | 53.7 | |
| Video-R1-7BTraining Type=RL Post-Training, Backbone=Video-R1-7B2026.05 | 55 | 63.6 | 40.3 | 52.2 | |
| LLaVA-OV-1.5-8B-RLTraining Type=RL Post-Training, Backbone=LLaVA-OV-1.5-8B2026.05 | 52.8 | 57.6 | 38.1 | 48.9 | |
| InternVL3.5-8B-InstructTraining Type=Supervised Fine-Tuned, Backbone=InternVL3.5-8B2026.05 | 47.4 | 60.6 | 44 | 49.9 | |
| InternVL3.5-8BTraining Type=RL Post-Training, Backbone=InternVL3.5-8B2026.05 | 43.8 | 58.1 | 43.3 | 47.6 | |
| LongVILA-R1-7BTraining Type=RL Post-Training, Backbone=LongVILA-R1-7B2026.05 | 40.9 | 45.7 | 28.4 | 37.8 |