Abstract Reasoning on Bongard-LOGO (HD)
61.1Mean AccuracyC–G + Concept (AP + C)
Evaluation Results
| Method | Links | |
|---|---|---|
| C–G + Concept (AP + C)Input Type=Symbolic (AP + Concept), Evaluation Subset=12 language models2026.04 | 61.1 | |
| C–G (AP)Input Type=Symbolic (Action Program), Evaluation Subset=12 language models2026.04 | 61 | |
| Minimal-Context GrammarInput Type=Symbolic (Base), Evaluation Subset=12 language models2026.04 | 59.6 | |
| C–G (AD)Input Type=Symbolic (Action Description), Evaluation Subset=12 language models2026.04 | 59.1 | |
| Grounded C–G (AP)Input Type=Symbolic + Visual, Evaluation Subset=Matched 4-model VLM-capable, Grounded=true2026.04 | 58.2 | |
| Visual baseline (VLM subset)Input Type=Visual, Evaluation Subset=Matched 4-model VLM-capable2026.04 | 57.5 | |
| Grounded C–G (AD)Input Type=Symbolic + Visual, Evaluation Subset=Matched 4-model VLM-capable, Grounded=true2026.04 | 55.8 | |
| Visual VLM (Gemini-2.5)Input Type=Visual, Evaluation Subset=12 language models2026.04 | 50.1 |