Enterprise Task Completion on EnterpriseBench
0.47Execution ScoreGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oEvaluator=GPT-4o2026.03 | 0.47 | |
| GPT-4oEvaluator model=Claude-4.5-Sonnet2026.03 | 0.44 | |
| ToolAceEvaluator=GPT-4o2026.03 | 0.41 | |
| XLAM-2-70BEvaluator=GPT-4o2026.03 | 0.4 | |
| ToolAceEvaluator model=Claude-4.5-Sonnet2026.03 | 0.39 | |
| XLAM-2-70BEvaluator model=Claude-4.5-Sonnet2026.03 | 0.39 | |
| Qwen3-4B (Agentic GRPO)Evaluator=GPT-4o, Variant=Agentic GRPO2026.03 | 0.38 | |
| Qwen3-4B (Agentic GRPO)Evaluator model=Claude-4.5-Sonnet, Training stage=Agentic GRPO2026.03 | 0.36 | |
| Qwen3-4B (SFT)Evaluator=GPT-4o, Variant=SFT2026.03 | 0.32 | |
| Qwen3-4B (SFT)Evaluator model=Claude-4.5-Sonnet, Training stage=SFT2026.03 | 0.31 | |
| Qwen3-4B (Base)Evaluator=GPT-4o, Variant=Base2026.03 | 0.27 | |
| Qwen3-4B (Base)Evaluator model=Claude-4.5-Sonnet, Training stage=Base2026.03 | 0.25 |