Success Rate (%) on ALFWorld Seen
85.7Success Rate (%)GRPO w/ EVU
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO w/ EVUMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=GRPO, EVU Mechanism=Included2026.04 | 85.7 | |
| GRPOMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=GRPO, EVU Mechanism=None2026.04 | 83.6 | |
| PPO w/ EVUMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=PPO, EVU Mechanism=Included2026.04 | 79.3 | |
| PPOMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=PPO, EVU Mechanism=None2026.04 | 77.8 | |
| SFT w/ EVUMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=SFT, EVU Mechanism=Included2026.04 | 70 | |
| SFTMethod Category=Training, Backbone Model=Qwen2.5-3B-Instruct, Base Method=SFT, EVU Mechanism=None2026.04 | 65.7 | |
| ReAct w/ EVUMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=ReAct, EVU Mechanism=Included2026.04 | 56.4 | |
| ReActMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=ReAct, EVU Mechanism=None2026.04 | 55.7 | |
| NoThinking w/ EVUMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=NoThinking, EVU Mechanism=Included2026.04 | 55 | |
| Plan-and-Act w/ EVUMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=Plan-and-Act, EVU Mechanism=Included2026.04 | 53.6 | |
| Plan-and-ActMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=Plan-and-Act, EVU Mechanism=None2026.04 | 52.1 | |
| GRPO w/ EVUMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=GRPO, EVU Mechanism=Included2026.04 | 52.1 | |
| NoThinkingMethod Category=Prompting, Backbone Model=DeepSeek V3.2, Base Method=NoThinking, EVU Mechanism=None2026.04 | 50.7 | |
| PPO w/ EVUMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=PPO, EVU Mechanism=Included2026.04 | 47.1 | |
| GRPOMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=GRPO, EVU Mechanism=None2026.04 | 47 | |
| PPOMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=PPO, EVU Mechanism=None2026.04 | 42.1 | |
| SFT w/ EVUMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=SFT, EVU Mechanism=Included2026.04 | 41.4 | |
| SFTMethod Category=Training, Backbone Model=Qwen3-1.7B-Instruct, Base Method=SFT, EVU Mechanism=None2026.04 | 37.1 |