System Throughput for Knowledge Retrieval on HotpotQA
93LLM Throughput (token/s)FlashEvolve
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FlashEvolveDeployment=vLLM, Model=Qwen3-8B2026.05 | 93 | 8.8 | |
| CombeeDeployment=vLLM, Model=Qwen3-8B, K (parallelization size)=402026.05 | 44 | 4.5 | |
| CombeeDeployment=vLLM, Model=Qwen3-8B, K (parallelization size)=102026.05 | 38 | 2.7 | |
| FlashEvolveDeployment=API, Model=GPT-4o-mini2026.05 | 32 | 8 | |
| GEPADeployment=vLLM, Model=Qwen3-8B2026.05 | 30 | 4.6 | |
| CombeeDeployment=API, Model=GPT-4o-mini, K (parallelization size)=402026.05 | 23 | 1.2 | |
| CombeeDeployment=API, Model=GPT-4o-mini, K (parallelization size)=102026.05 | 18 | 1.4 | |
| GEPADeployment=API, Model=GPT-4o-mini2026.05 | 14 | 2.4 |