Operating System Control on AgentBench OS
37.6AccuracyINFOTREE
Evaluation Results
| Method | Links | |
|---|---|---|
| INFOTREE2026.05 | 37.6 | |
| OpenHands CodeActAgentModel=Qwen-2.5-32B-Coder-Instruct, Training Data=ADP Data2025.10 | 34.7 | |
| Tree-GRPO2026.05 | 33.8 | |
| Flat GRPO2026.05 | 31.4 | |
| OpenHands CodeActAgentModel=Qwen-2.5-32B-Coder-Instruct, Training Data=–2025.10 | 27.8 | |
| OpenHands CodeActAgentModel=Qwen-2.5-7B-Coder-Instruct, Training Data=ADP Data2025.10 | 27.1 | |
| AgentLMModel=Llama-2-chat-70B, Training Data=AgentInstruct (Zeng et al., 2023)2025.10 | 21.5 | |
| OpenHands CodeActAgentModel=Qwen-2.5-14B-Coder-Instruct, Training Data=ADP Data2025.10 | 20.8 | |
| AgentLMModel=Llama-2-chat-13B, Training Data=AgentInstruct (Zeng et al., 2023)2025.10 | 18.1 | |
| AgentLMModel=Llama-2-chat-7B, Training Data=AgentInstruct (Zeng et al., 2023)2025.10 | 17.4 | |
| AgentLMModel=Llama-2-chat-70B, Training Data=–2025.10 | 9 | |
| AgentLMModel=Llama-2-chat-13B, Training Data=–2025.10 | 9 | |
| AgentLMModel=Llama-2-chat-7B, Training Data=–2025.10 | 8.3 | |
| OpenHands CodeActAgentModel=Qwen-2.5-7B-Coder-Instruct, Training Data=–2025.10 | 3.5 | |
| OpenHands CodeActAgentModel=Qwen-2.5-14B-Coder-Instruct, Training Data=–2025.10 | 2.8 |