Attention Latency on Qwen3-30B-A3B-Instruct-2507 (128K Context)
1.56Speedup FactorCompactAttention-FP
Evaluation Results
| Method | Links | |
|---|---|---|
| CompactAttention-FPGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1.56 | |
| FlashPrefillGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1.05 | |
| QUOKAGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1.04 | |
| DenseGPU=H200 SXM, TP=2, Batch Size=4, Chunk Size=10242026.05 | 1 |