Embodied Agent Task on VirtualHome Unseen
36.9Success RateGRPO w/ EVU
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO w/ EVUMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=GRPO, EVU Mechanism=Included2026.04 | 36.9 | |
| GRPO w/ EVUMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=GRPO, EVU Mechanism=Included2026.04 | 36 | |
| PPO w/ EVUMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=PPO, EVU Mechanism=Included2026.04 | 35.2 | |
| SFT w/ EVUMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=SFT, EVU Mechanism=Included2026.04 | 34.4 | |
| PPO w/ EVUMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=PPO, EVU Mechanism=Included2026.04 | 28.8 | |
| SFT w/ EVUMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=SFT, EVU Mechanism=Included2026.04 | 25.6 | |
| GRPOMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=GRPO, EVU Mechanism=None2026.04 | 24.8 | |
| PPOMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=PPO, EVU Mechanism=None2026.04 | 23.2 | |
| PPOMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=PPO, EVU Mechanism=None2026.04 | 22.4 | |
| SFTMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=SFT, EVU Mechanism=None2026.04 | 20 | |
| GRPOMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=GRPO, EVU Mechanism=None2026.04 | 19.4 | |
| Plan-and-Act w/ EVUMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=Plan-and-Act, EVU Mechanism=Included2026.04 | 14.4 | |
| ReAct w/ EVUMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=ReAct, EVU Mechanism=Included2026.04 | 13.6 | |
| NoThinking w/ EVUMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=NoThinking, EVU Mechanism=Included2026.04 | 12.8 | |
| Plan-and-ActMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=Plan-and-Act, EVU Mechanism=None2026.04 | 12.8 | |
| ReActMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=ReAct, EVU Mechanism=None2026.04 | 12.8 | |
| SFTMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=SFT, EVU Mechanism=None2026.04 | 8 | |
| NoThinkingMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=NoThinking, EVU Mechanism=None2026.04 | 7.2 |