LLM Inference Efficiency on Efficient Qwen Competition Scenarios (Short/Medium/Long)
6.978Average SpeedupAFM-k5984d3s (Ours)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AFM-k5984d3s (Ours)Target Model Quantization=QAD (Quantization-Aware Distillation), Drafter Model=Quantized Block-diffusion drafter (PTQ), Decoding Strategy=Speculative Decoding, Attention Mechanism=Sliding-Window Attention (SWA)2026.07 | 6.978 | 232 | 782 | 2,313 | |
| BaselinePrecision=BF16, Optimization Strategy=Unoptimized2026.07 | 1 | 2,582 | 5,441 | 6,576 |