Cacheback: Speculative Decoding With Nothing But Cache
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Zhiyao, Gim, In, Zhong, Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Attention Speculative Decoding
par: Zhong, Wei, et autres
Publié: (2025)
par: Zhong, Wei, et autres
Publié: (2025)
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
par: Gim, In, et autres
Publié: (2023)
par: Gim, In, et autres
Publié: (2023)
Asynchronous LLM Function Calling
par: Gim, In, et autres
Publié: (2024)
par: Gim, In, et autres
Publié: (2024)
The Disparate Impacts of Speculative Decoding
par: Sandler, Jameson, et autres
Publié: (2025)
par: Sandler, Jameson, et autres
Publié: (2025)
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)
par: Liu, Xiaoxuan, et autres
Publié: (2025)
Mamba Drafters for Speculative Decoding
par: Choi, Daewon, et autres
Publié: (2025)
par: Choi, Daewon, et autres
Publié: (2025)
Constrained Decoding with Speculative Lookaheads
par: Nakshatri, Nishanth, et autres
Publié: (2024)
par: Nakshatri, Nishanth, et autres
Publié: (2024)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
par: Jin, Tao, et autres
Publié: (2026)
par: Jin, Tao, et autres
Publié: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
par: Brown, Oscar, et autres
Publié: (2024)
par: Brown, Oscar, et autres
Publié: (2024)
Batch Speculative Decoding Done Right
par: Zhang, Ranran Haoran, et autres
Publié: (2025)
par: Zhang, Ranran Haoran, et autres
Publié: (2025)
RASD: Retrieval-Augmented Speculative Decoding
par: Quan, Guofeng, et autres
Publié: (2025)
par: Quan, Guofeng, et autres
Publié: (2025)
Speculative Decoding for Multi-Sample Inference
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
par: Su, Xin, et autres
Publié: (2026)
par: Su, Xin, et autres
Publié: (2026)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
par: Zhang, Situo, et autres
Publié: (2026)
par: Zhang, Situo, et autres
Publié: (2026)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)
par: He, Zhenyu, et autres
Publié: (2023)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
par: Hu, Shijing, et autres
Publié: (2025)
par: Hu, Shijing, et autres
Publié: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
par: Zhang, Zihong, et autres
Publié: (2026)
par: Zhang, Zihong, et autres
Publié: (2026)
Acceptance Dynamics Across Cognitive Domains in Speculative Decoding
par: Mahmoud, Saif
Publié: (2026)
par: Mahmoud, Saif
Publié: (2026)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
par: Sun, Shengyin, et autres
Publié: (2025)
par: Sun, Shengyin, et autres
Publié: (2025)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)
par: Wu, Zhaoxuan, et autres
Publié: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
par: Li, Guanghao, et autres
Publié: (2025)
par: Li, Guanghao, et autres
Publié: (2025)
When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
par: Fang, Min, et autres
Publié: (2025)
par: Fang, Min, et autres
Publié: (2025)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
par: Su, Tiancheng, et autres
Publié: (2025)
par: Su, Tiancheng, et autres
Publié: (2025)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
par: Wang, Ziyao, et autres
Publié: (2025)
par: Wang, Ziyao, et autres
Publié: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024)
par: Sun, Ryan, et autres
Publié: (2024)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
par: Liao, Mengqi, et autres
Publié: (2025)
par: Liao, Mengqi, et autres
Publié: (2025)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
par: Hu, Shijing, et autres
Publié: (2025)
par: Hu, Shijing, et autres
Publié: (2025)
SAM Decoding: Speculative Decoding via Suffix Automaton
par: Hu, Yuxuan, et autres
Publié: (2024)
par: Hu, Yuxuan, et autres
Publié: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025)
par: Kumar, Avinash, et autres
Publié: (2025)
Benchmarking the Energy Savings with Speculative Decoding Strategies
par: Dutta, Rohit, et autres
Publié: (2026)
par: Dutta, Rohit, et autres
Publié: (2026)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
par: Yin, Ming, et autres
Publié: (2024)
par: Yin, Ming, et autres
Publié: (2024)
OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
par: Lee, Jaeseong, et autres
Publié: (2025)
par: Lee, Jaeseong, et autres
Publié: (2025)
Documents similaires
-
Cross-Attention Speculative Decoding
par: Zhong, Wei, et autres
Publié: (2025) -
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
par: Gim, In, et autres
Publié: (2023) -
Asynchronous LLM Function Calling
par: Gim, In, et autres
Publié: (2024) -
The Disparate Impacts of Speculative Decoding
par: Sandler, Jameson, et autres
Publié: (2025) -
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)