Text Generation on QA
117.17Throughput (tokens/s)EVICT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVICTTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 117.17 | — | |
| EVICTTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 112.48 | — | |
| EAGLE-3Temperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 96.31 | — | |
| EAGLE-3Temperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 93.15 | — | |
| DDDTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 92.17 | — | |
| DDDTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 90.77 | — | |
| VanillaTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 84.11 | — | |
| VanillaTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 83.65 | — | |
| LookaheadTemperature=0, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 57.01 | — | |
| LookaheadTemperature=1, Backbone=Qwen3-235B-A22B, Inference Engine=SGLang, Hardware=NVIDIA A100 SXM4 80GB GPUs, Batch Size=1, Tensor Parallelism=TP=82026.05 | 55.67 | — |