Embodied Task Completion on AI2-THOR (test)
75SRReCAPA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ReCAPAModel Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 75 | 93 | 95 | 93 | |
| LLaMARModel Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 68 | 90 | 95 | 85 | |
| GPT-4VModel Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 66 | 91 | 97 | 82 | |
| CogVLMModel Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 61 | 89 | 95 | 80 | |
| IDEFICS-2Model Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 57 | 86 | 94 | 78 | |
| LLaVAModel Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 54 | 84 | 91 | 75 | |
| GPT-4oModel Category=Multi-Modal/LLM-Enhanced Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 51 | 85 | 95 | 83 | |
| ReActModel Category=Single-LM/Agent Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 34 | 72 | 92 | 67 | |
| CoELAModel Category=Single-LM/Agent Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 25 | 46 | 76 | 73 | |
| CoTModel Category=Single-LM/Agent Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 14 | 59 | 87 | 62 | |
| SmartLLMModel Category=Single-LM/Agent Baselines, Evaluation Protocol=Direct evaluation without fine-tuning2026.04 | 11 | 23 | 91 | 45 |