Question Answering on GPQA (TPS, Accuracy)
31.92AccuracyLLaMA3 8B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLaMA3 8BBackbone=LLaMA3 8B2025.06 | 31.92 | 33.79 | 21.12 | |
| LLaDABackbone=LLaDA 8B2025.06 | 31.47 | 1.6 | 1 | |
| LLaDA + SlowFastBackbone=LLaDA 8B, Sampling Strategy=SlowFast Sampling2025.06 | 31.47 | 25 | 15.63 | |
| LLaDA + SlowFast + CacheBackbone=LLaDA 8B, Sampling Strategy=SlowFast Sampling, Cache Configuration=Kp = 100, Kr = 52025.06 | 30.13 | 48.8 | 30.5 | |
| BICACHEcaching=BICACHE2026.05 | 30.1 | 79.9 | — | |
| LLaDA + SlowFast + CacheBackbone=LLaDA 8B, Sampling Strategy=SlowFast Sampling, Cache Configuration=Kp = 500, Kr = 302025.06 | 28.79 | 54.75 | 34.22 | |
| ExpGraphBackbone Model=Llama-3.1-8B-Instruct (Large LLM), Method Category=LLM-Centric Experience Learning Baselines2026.05 | 28.33 | — | — | |
| No cachingSetting=Main Improvements (§6.2)2026.05 | 27.9 | 72 | — | |
| No cachingcaching=None2026.05 | 27.9 | 60.5 | — | |
| BICACHESetting=Main Improvements (§6.2)2026.05 | 27.5 | 98.1 | — | |
| BICACHE + Fast-dLLMSetting=Integration Results (§6.3)2026.05 | 27.2 | 124.6 | — | |
| Fast-dLLMoptimization=Fast-dLLM2026.05 | 27.2 | 77.1 | — | |
| ExpGraphBackbone Model=Llama-3.2-3B-Instruct (Small LLM), Method Category=LLM-Centric Experience Learning Baselines2026.05 | 27 | — | — | |
| Fast-dLLMSetting=Integration Results (§6.3)2026.05 | 27 | 82.1 | — | |
| BICACHE + Fast-dLLMcaching=BICACHE, optimization=Fast-dLLM2026.05 | 27 | 116.5 | — | |
| vLLMSetting=Main Improvements (§6.2)2026.05 | 0.7 | 99.7 | — | |
| vLLMframework=vLLM2026.05 | 0 | 80.4 | — |