Text Generation on HumanEval (Throughput)
188.12Throughput (tokens/s)EVICT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVICTTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 188.12 | — | |
| EVICTTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 183.21 | — | |
| EAGLE-3Temperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 144.34 | — | |
| EAGLE-3Temperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 141.31 | — | |
| DDDTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 137.64 | — | |
| DDDTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 135.7 | — | |
| VanillaTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 80.61 | — | |
| VanillaTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 76.73 | — | |
| LookaheadTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 63.32 | — | |
| LookaheadTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 62.96 | — |