Long-context Modeling Efficiency on InfiniteBench
9Decoding SpeedupLAVA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LAVA2026.03 | 9 | 0.01 | 0.6 | |
| Hybrid Verified DecodingTarget Model=Qwen3-4B, Reference Baseline=Greedy Decoding2026.05 | 5.53 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-8B, Reference Baseline=Greedy Decoding2026.05 | 5.03 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-8B, Reference Baseline=SuffixDecoding2026.05 | 3.04 | — | — | |
| Hybrid Verified DecodingTarget Model=Llama3.1-8B, Reference Baseline=Frequency-Based Hybrid Decoding2026.05 | 2.94 | — | — | |
| Hybrid Verified DecodingTarget Model=Llama3.1-8B, Reference Baseline=EAGLE32026.05 | 2.84 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-4B, Reference Baseline=EAGLE32026.05 | 2.51 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-8B, Reference Baseline=EAGLE32026.05 | 2.42 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-4B, Reference Baseline=SuffixDecoding2026.05 | 2.4 | — | — | |
| Hybrid Verified DecodingTarget Model=Llama3.1-8B, Reference Baseline=Greedy Decoding2026.05 | 2.23 | — | — | |
| Hybrid Verified DecodingTarget Model=Llama3.1-8B, Reference Baseline=SuffixDecoding2026.05 | 1.47 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-8B, Reference Baseline=Frequency-Based Hybrid Decoding2026.05 | 1.21 | — | — | |
| Hybrid Verified DecodingTarget Model=Qwen3-4B, Reference Baseline=Frequency-Based Hybrid Decoding2026.05 | 1.16 | — | — |