Abstract Reasoning on Bongard-LOGO (FF)
79.3Mean AccuracyC–G (AD)
Evaluation Results
| Method | Links | |
|---|---|---|
| C–G (AD)Input Type=Symbolic (Action Description), Evaluation Subset=12 language models2026.04 | 79.3 | |
| C–G + Concept (AP + C)Input Type=Symbolic (AP + Concept), Evaluation Subset=12 language models2026.04 | 79.3 | |
| C–G (AP)Input Type=Symbolic (Action Program), Evaluation Subset=12 language models2026.04 | 78.1 | |
| Minimal-Context GrammarInput Type=Symbolic (Base), Evaluation Subset=12 language models2026.04 | 77.3 | |
| Category PermutationCondition=Randomization, Evaluation Subset=12 language models2026.04 | 70.6 | |
| Visual baseline (VLM subset)Input Type=Visual, Evaluation Subset=Matched 4-model VLM-capable2026.04 | 62.6 | |
| Grounded C–G (AP)Input Type=Symbolic + Visual, Evaluation Subset=Matched 4-model VLM-capable, Grounded=true2026.04 | 62.4 | |
| Grounded C–G (AD)Input Type=Symbolic + Visual, Evaluation Subset=Matched 4-model VLM-capable, Grounded=true2026.04 | 61.2 | |
| Sequence PermutationCondition=Randomization, Evaluation Subset=12 language models2026.04 | 58 | |
| Visual VLM (Gemini-2.5)Input Type=Visual, Evaluation Subset=12 language models2026.04 | 50.2 |