Error Detection on CoSPlan Maze-E
0.403AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oReasoning Strategy=Chain-of-Thought2025.12 | 0.403 | |
| GPT-4oReasoning Strategy=Scene Graph2025.12 | 0.353 | |
| Intern-VLMReasoning Strategy=Scene Graph2025.12 | 0.334 | |
| Intern-VLMReasoning Strategy=Chain-of-Thought2025.12 | 0.331 | |
| Intern-VLMReasoning Strategy=Vanilla2025.12 | 0.328 | |
| Random2025.12 | 0.261 | |
| Janus-pro-7BReasoning Strategy=Scene Graph2025.12 | 0.21 | |
| Qwen2 VL-8BReasoning Strategy=Chain-of-Thought2025.12 | 0.208 | |
| Qwen2 VL-8BReasoning Strategy=Scene Graph2025.12 | 0.207 | |
| Qwen2 VL-8BReasoning Strategy=Vanilla2025.12 | 0.205 | |
| Janus-pro-7BReasoning Strategy=Vanilla2025.12 | 0.205 | |
| Janus-pro-7BReasoning Strategy=Chain-of-Thought2025.12 | 0.191 | |
| CoG-VLMReasoning Strategy=Scene Graph2025.12 | 0.133 | |
| CoG-VLMReasoning Strategy=Chain-of-Thought2025.12 | 0.084 | |
| CoG-VLMReasoning Strategy=Vanilla2025.12 | 0.064 |