End-to-End Runtime Evaluation on External Benchmark 12-task subset
50Planner ClarityGPT-OSS-120B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-OSS-120BTasks=12, Path=Full OpenPort Path, Certificates=Model-generated, Planner Output=Model-generated2026.06 | 50 | 50 | 25 | 0 | 75 | 13,761.5 | |
| Qwen3-Next-80BTasks=12, Path=Full OpenPort Path, Certificates=Model-generated, Planner Output=Model-generated2026.06 | 8.33 | 91.67 | 25 | 0 | 75 | 7,357.1 | |
| Llama-3.3-70BTasks=12, Path=Full OpenPort Path, Certificates=Model-generated, Planner Output=Model-generated2026.06 | 0 | 100 | 12.5 | 0 | 75 | 53,145.2 |