Agentic Reasoning on ALFWorld (Action Success Rates)
97.2Pick Success RateHölderPO
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| HölderPOBase Model=Qwen2.5-Instruct-1.5B, Schedule=Linear Dec: 2 → -22026.05 | 97.2 | 85.7 | 87.5 | 91.7 | 79.2 | 81.5 | 87.5 | |
| HölderPOBase Model=Qwen2.5-Instruct-1.5B, Schedule=Linear Dec: 1 → -12026.05 | 96.9 | 100 | 100 | 100 | 85.7 | 84.5 | 93.8 | |
| GiGPOBase Model=Qwen2.5-Instruct-1.5B2026.05 | 94.4 | 67.5 | 94.8 | 94.4 | 79.8 | 76.4 | 86.7 | |
| GMPOBase Model=Qwen2.5-Instruct-1.5B, p=→ 02026.05 | 93.1 | 78.6 | 81 | 88.2 | 82.1 | 89.5 | 85.9 | |
| GRPOBase Model=Qwen2.5-Instruct-1.5B, p=12026.05 | 85.3 | 53.7 | 84.5 | 78.2 | 59.7 | 53.5 | 72.8 |