Abstract Reasoning on Bongard-LOGO (BD)
72Mean AccuracyC–G (AD)
Evaluation Results
| Method | Links | |
|---|---|---|
| C–G (AD)Input Type=Symbolic (Action Description), Evaluation Subset=12 language models2026.04 | 72 | |
| C–G + Concept (AP + C)Input Type=Symbolic (AP + Concept), Evaluation Subset=12 language models2026.04 | 70 | |
| C–G (AP)Input Type=Symbolic (Action Program), Evaluation Subset=12 language models2026.04 | 68.8 | |
| Minimal-Context GrammarInput Type=Symbolic (Base), Evaluation Subset=12 language models2026.04 | 67.7 | |
| Sequence PermutationCondition=Randomization, Evaluation Subset=12 language models2026.04 | 64.2 | |
| Category PermutationCondition=Randomization, Evaluation Subset=12 language models2026.04 | 60.1 | |
| Visual baseline (VLM subset)Input Type=Visual, Evaluation Subset=Matched 4-model VLM-capable2026.04 | 57.1 | |
| Grounded C–G (AP)Input Type=Symbolic + Visual, Evaluation Subset=Matched 4-model VLM-capable, Grounded=true2026.04 | 55.3 | |
| Grounded C–G (AD)Input Type=Symbolic + Visual, Evaluation Subset=Matched 4-model VLM-capable, Grounded=true2026.04 | 55.3 | |
| Visual VLM (Gemini-2.5)Input Type=Visual, Evaluation Subset=12 language models2026.04 | 49.8 |