Common Sense Reasoning on WorldSense
64.6AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProModel Accessibility=Proprietary2026.05 | 64.6 | |
| Gemini-2.0-FlashModel Accessibility=Proprietary2026.05 | 56.2 | |
| LatentOmniModel Accessibility=Open-source, Training/Reasoning Strategy=Latent reasoning2026.05 | 48.9 | |
| OmniVinciModel Accessibility=Open-source2026.05 | 48.2 | |
| Qwen2.5-Omni-7B + Vanilla SFTModel Accessibility=Open-source, Training/Reasoning Strategy=Vanilla SFT2026.05 | 47.5 | |
| HumanOmniV2-7BModel Accessibility=Open-source2026.05 | 47.1 | |
| Qwen2.5-Omni-7B + Explicit Text CoTModel Accessibility=Open-source, Training/Reasoning Strategy=Explicit Text CoT2026.05 | 46.6 | |
| Qwen2.5-Omni-7BModel Accessibility=Open-source, Training/Reasoning Strategy=Base2026.05 | 45.4 | |
| Baichuan-Omni-1.5Model Accessibility=Open-source2026.05 | 43.3 | |
| GPT-4oModel Accessibility=Proprietary2026.05 | 42.6 | |
| VITA-1.5-7BModel Accessibility=Open-source2026.05 | 36.9 | |
| MiniCPM-o-7BModel Accessibility=Open-source2026.05 | 29.7 | |
| VideoLLaMA2-7BModel Accessibility=Open-source2026.05 | 25.4 | |
| Llama 3 405B2024.07 | 0.637 | |
| Llama 3 70B2024.07 | 0.611 | |
| Mixtral 8x22B2024.07 | 0.515 | |
| Gemma 7B2024.07 | 0.46 | |
| Llama 3 8B2024.07 | 0.455 | |
| Mistral 7B2024.07 | 0.449 |