Interactive Agent Task on ScienceWorld
11.5Efficiency FactorAGORA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AGORABackbone=gpt-5-mini, Per-step LLM call=false2026.05 | 11.5 | 0.016 | |
| AgentDietBackbone=qwen3.5-flash, Per-step LLM call=true2026.05 | 3.6 | 0.0002 | |
| ACONBackbone=gpt-5-mini, Per-step LLM call=true2026.05 | 3.4 | 0.0077 | |
| AgentDietBackbone=gpt-4o-mini, Per-step LLM call=true2026.05 | 3.3 | 0.0009 | |
| AgentDietBackbone=gpt-5-mini, Per-step LLM call=true2026.05 | 3.2 | 0.0082 | |
| ACONBackbone=qwen3.5-flash, Per-step LLM call=true2026.05 | 3.2 | 0.0002 | |
| HiAgentBackbone=gpt-5-mini, Per-step LLM call=true2026.05 | 3 | 0.0082 | |
| ACONBackbone=gpt-4o-mini, Per-step LLM call=true2026.05 | 3 | 0.001 | |
| HiAgentBackbone=qwen3.5-flash, Per-step LLM call=true2026.05 | 2.9 | 0.0003 | |
| HiAgentBackbone=gpt-4o-mini, Per-step LLM call=true2026.05 | 2.9 | 0.001 | |
| AGORABackbone=qwen3.5-flash, Per-step LLM call=false2026.05 | 1.8 | 0.0006 | |
| ObsMaskBackbone=gpt-5-mini, Per-step LLM call=false2026.05 | 1.5 | 0.0146 | |
| AGORABackbone=gpt-4o-mini, Per-step LLM call=false2026.05 | 1.4 | 0.0019 | |
| ObsMaskBackbone=qwen3.5-flash, Per-step LLM call=false2026.05 | 1.3 | 0.0006 | |
| ObsMaskBackbone=gpt-4o-mini, Per-step LLM call=false2026.05 | 1.3 | 0.0023 |