Text Generation on CNN/DM
111.89Throughput (tokens/s)EVICT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVICTTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 111.89 | — | |
| EVICTTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 108.98 | — | |
| EAGLE-3Temperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 89.49 | — | |
| DDDTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 89.14 | — | |
| EAGLE-3Temperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 88.14 | — | |
| DDDTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 86.97 | — | |
| VanillaTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 83.64 | — | |
| VanillaTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 82.56 | — | |
| LookaheadTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 50.69 | — | |
| LookaheadTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 50.46 | — |