Multimodal Reasoning on BabyVision (test)
49.7AccuracyGemini-3-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3-ProProtocol=Zero-shot2026.06 | 49.7 | |
| GPT-5.2Protocol=Zero-shot2026.06 | 34.4 | |
| Doubao-1.8Protocol=Zero-shot2026.06 | 30.2 | |
| ATLAS-MMBackbone=Claude Sonnet 4.62026.06 | 23.97 | |
| ATLASBackbone=Claude Sonnet 4.62026.06 | 23.71 | |
| Majority VotingBackbone=Claude Sonnet 4.62026.06 | 23.2 | |
| Budget ForcingBackbone=Claude Sonnet 4.62026.06 | 21.91 | |
| Self-RefineBackbone=Claude Sonnet 4.62026.06 | 21.39 | |
| Self-Refine (no early stop)Backbone=Claude Sonnet 4.62026.06 | 21.13 | |
| Reward-model rerankingBackbone=Claude Sonnet 4.6, Reward Model=VisualPRM2026.06 | 20.88 | |
| Pass@1Backbone=Claude Sonnet 4.62026.06 | 19.59 | |
| Qwen3-VL-PlusProtocol=Zero-shot2026.06 | 19.2 | |
| Grok-4Protocol=Zero-shot2026.06 | 16.2 |