ResearchBenchmarksLogical Reasoning on BBH (first 1,000 samples subset)Follow86.2Exact Match AccuracyMGRS75.59278.34681.183.854Nov 28, 2025Evaluation ResultsMethodMethodLinksExact Match AccuracyMGRSBackbone=GPT-4o-miniBackbone=GPT-4o-mini2025.1186.2AoTBackbone=GPT-4o-miniBackbone=GPT-4o-mini2025.1186CoT-SCBackbone=GPT-4o-mini, n=5Backbone=GPT-4o-mini, n=52025.1183.4FoTBackbone=GPT-4o-mini, n=8Backbone=GPT-4o-mini, n=82025.1182.4Self-refineBackbone=GPT-4o-miniBackbone=GPT-4o-mini2025.1180CoTBackbone=GPT-4o-miniBackbone=GPT-4o-mini2025.1178.3AFlowBackbone=GPT-4o-miniBackbone=GPT-4o-mini2025.1176