Social Behavior Recognition on Human Behavior Atlas (test)
77.7EMO ScoreGPG
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPGTraining Algorithm=GPG, Base Model=Qwen 2.5-Omni-7B, Reward Design=Identical2026.02 | 77.7 | 69.28 | 54.21 | 98.39 | 90.4 | 78.4 | 75.77 | 45.96 | 27.93 | 12.79 | 2.5 | |
| OmniSapiens-7B 2.0Training Algorithm=HARPO2026.02 | 76.55 | 69.85 | 50.52 | 98.39 | 91.98 | 78.87 | 77.61 | 70.64 | 25.4 | 14.54 | 1.2 | |
| HARPOTraining Algorithm=HARPO, Base Model=Qwen 2.5-Omni-7B, Reward Design=Identical2026.02 | 76.55 | 69.85 | 50.52 | 98.39 | 91.98 | 78.87 | 77.61 | 70.64 | 25.4 | 14.54 | 1.7 | |
| GRPOTraining Algorithm=GRPO, Base Model=Qwen 2.5-Omni-7B, Reward Design=Identical2026.02 | 76.45 | 27.56 | 49.9 | 98.39 | 90.4 | 77.64 | 77.51 | 53.58 | 23.3 | 11 | 3.3 | |
| RE++Training Algorithm=RE++, Base Model=Qwen 2.5-Omni-7B, Reward Design=Identical2026.02 | 75.92 | 60.26 | 5.01 | 98.39 | 93.11 | 73.87 | 56.52 | 50.21 | 12.64 | 4.07 | 3.9 | |
| RLOOTraining Algorithm=RLOO, Base Model=Qwen 2.5-Omni-7B, Reward Design=Identical2026.02 | 75.58 | 67.86 | 51.73 | 98.39 | 90.68 | 77.57 | 76.86 | 62.58 | 29.54 | 16.28 | 2.5 | |
| HumanOmniV2-7Bsubstantive multitask training=true2026.02 | 59.7 | 63.8 | 26.3 | 82.4 | 52.7 | 65.4 | 74.2 | 39.5 | 28.2 | 9.3 | 4 | |
| Qwen 2.5-Omni-7B2026.02 | 58.25 | 54.3 | 25.4 | 76 | 79.3 | 71.35 | 67.2 | 65.6 | 25.4 | 6.9 | 4.2 | |
| Qwen 3-VL-8B-Instruct2026.02 | 57.66 | 66.76 | 38 | 92.7 | 42.29 | 51.62 | 69.7 | 63.67 | 24.94 | 13.95 | 4 | |
| OmniSapiens-7B RLsubstantive multitask training=true2026.02 | 57.28 | 63.9 | 48.6 | 96.8 | 91.9 | 77.15 | 39.6 | 64.7 | 30.4 | 13.3 | 3 | |
| Gemma-3-4B2026.02 | 55.03 | 59.7 | 22.7 | 49.9 | 60.1 | 46.25 | 73.83 | 52.9 | 19.1 | 2.3 | 5.9 | |
| Qwen 2.5-VL-7B2026.02 | 54.08 | 58.3 | 24.9 | 75.5 | 63.1 | 63.8 | 50.5 | 51.1 | 23.1 | 9.8 | 5.6 |