Agentic Performance on ACEBench Agent
60End-to-End AccuracyQwen3-14B + ARTIS (Sequential)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-14B + ARTIS (Sequential)Model backbone=Qwen3-14B, Test-time scaling method=ARTIS (Sequential)2026.02 | 60 | 63.3 | |
| Qwen3-14B + Weighted BoNModel backbone=Qwen3-14B, Test-time scaling method=Weighted BoN2026.02 | 55 | 55.8 | |
| Qwen3-14B + ARTIS (Parallel)Model backbone=Qwen3-14B, Test-time scaling method=ARTIS (Parallel)2026.02 | 55 | 55.6 | |
| Qwen3-14B + Sequential RevisionModel backbone=Qwen3-14B, Test-time scaling method=Sequential Revision2026.02 | 50 | 50 | |
| Qwen3-14BModel backbone=Qwen3-14B, Test-time scaling method=None (Direct execution)2026.02 | 45 | 54.2 | |
| Qwen3-8B + ARTIS (Sequential)Model backbone=Qwen3-8B, Test-time scaling method=ARTIS (Sequential)2026.02 | 40 | 52.1 | |
| Qwen3-8B + ARTIS (Parallel)Model backbone=Qwen3-8B, Test-time scaling method=ARTIS (Parallel)2026.02 | 35 | 43.1 | |
| Qwen3-32B + ARTIS (Sequential)Model backbone=Qwen3-32B, Test-time scaling method=ARTIS (Sequential)2026.02 | 35 | 36.3 | |
| Qwen3-32B + ARTIS (Parallel)Model backbone=Qwen3-32B, Test-time scaling method=ARTIS (Parallel)2026.02 | 25 | 26.3 | |
| Qwen3-8B + Sequential RevisionModel backbone=Qwen3-8B, Test-time scaling method=Sequential Revision2026.02 | 20 | 20 | |
| Qwen3-32BModel backbone=Qwen3-32B, Test-time scaling method=None (Direct execution)2026.02 | 20 | 20 | |
| Qwen3-32B + Weighted BoNModel backbone=Qwen3-32B, Test-time scaling method=Weighted BoN2026.02 | 20 | 21.3 | |
| Qwen3-8B + Weighted BoNModel backbone=Qwen3-8B, Test-time scaling method=Weighted BoN2026.02 | 15 | 17.6 | |
| Qwen3-32B + Sequential RevisionModel backbone=Qwen3-32B, Test-time scaling method=Sequential Revision2026.02 | 15 | 25 | |
| Qwen3-8BModel backbone=Qwen3-8B, Test-time scaling method=None (Direct execution)2026.02 | 10 | 14.6 |