Social Reasoning on MotiveBench OOD (test)
0.9011Amazon ScoreGPT-4o
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-4o2026.01 | 0.9011 | 0.7744 | 0.7744 | 0.8166 | — | |
| HumanLLM_Qwen3Backbone=Qwen3-8B, Augmentation=True2026.01 | 0.8222 | 0.7033 | 0.7027 | 0.7427 | 3.3 | |
| Qwen3-8BBackbone=Qwen3-8B2026.01 | 0.8188 | 0.6655 | 0.6727 | 0.719 | — | |
| HumanLLM^t1_Qwen3Backbone=Qwen3, Variant=t12026.01 | 0.7988 | 0.6911 | 0.6866 | 0.7254 | 0.89 | |
| HumanLLM^t2_Qwen3Backbone=Qwen3, Variant=t22026.01 | 0.7966 | 0.6955 | 0.7138 | 0.7353 | 2.26 | |
| HumanLLM_Qwen2.5-7BBackbone=Qwen2.5-7B-Instruct, Augmentation=True2026.01 | 0.7677 | 0.6766 | 0.6866 | 0.7103 | 4.3 | |
| HumanLLM^gen_Qwen2.5-7BBackbone=Qwen2.5-7B-Instruct, Variant=gen2026.01 | 0.7544 | 0.6911 | 0.6688 | 0.7047 | 3.48 | |
| HumanLLM^raw_Qwen2.5-7BBackbone=Qwen2.5-7B-Instruct, Variant=raw2026.01 | 0.7488 | 0.6711 | 0.6661 | 0.6953 | 2.1 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct2026.01 | 0.7433 | 0.6366 | 0.6633 | 0.681 | — | |
| HumanLLM_phi-3Backbone=Phi-3-mini-128k-instruct, Augmentation=True2026.01 | 0.7422 | 0.6644 | 0.6311 | 0.6792 | 5.77 | |
| HumanLLM_LlamaBackbone=Llama-3.1-8B-Instruct, Augmentation=True2026.01 | 0.7355 | 0.7388 | 0.6311 | 0.7018 | 19.76 | |
| BE.FM2026.01 | 0.73 | 0.7244 | 0.6061 | 0.6868 | — | |
| Phi-3-mini-128k-instructBackbone=Phi-3-mini-128k-instruct2026.01 | 0.7244 | 0.6088 | 0.5933 | 0.6421 | — | |
| HumanLLM_Qwen2.5-3BBackbone=Qwen2.5-3B-Instruct, Augmentation=True2026.01 | 0.6744 | 0.6588 | 0.5833 | 0.6388 | 6.64 | |
| Qwen2.5-3B-InstructBackbone=Qwen2.5-3B-Instruct2026.01 | 0.6511 | 0.5711 | 0.58 | 0.599 | — | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct2026.01 | 0.5866 | 0.6499 | 0.5216 | 0.586 | — | |
| CentaurDescription=Fine-tuned from Llama-3.1-8B2026.01 | 0.0366 | 0.0488 | 0.0266 | 0.0373 | — |