Attention Latency on Qwen3-30B-A3B-Instruct-2507 (64K Context)
1.07Speedup FactorCompactAttention-FP
Evaluation Results
| Method | Links | |
|---|---|---|
| CompactAttention-FPGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1.07 | |
| DenseGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1 | |
| QUOKAGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 0.91 | |
| FlashPrefillGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 0.85 |