Cross-Attention Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhong, Wei, Bharadwaj, Manasa, Wang, Yixiao, Ji, Yipeng, Lee, Chul |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SMaRT: Select, Mix, and ReinvenT -- A Strategy Fusion Framework for LLM-Driven Reasoning and Planning
por: Verma, Nikhil, et al.
Publicado: (2025)
por: Verma, Nikhil, et al.
Publicado: (2025)
S3D: A Simple and Cost-Effective Self-Speculative Decoding Scheme for Low-Memory GPUs
por: Zhong, Wei, et al.
Publicado: (2024)
por: Zhong, Wei, et al.
Publicado: (2024)
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024)
por: Zimmer, Matthieu, et al.
Publicado: (2024)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
REST: Retrieval-Based Speculative Decoding
por: He, Zhenyu, et al.
Publicado: (2023)
por: He, Zhenyu, et al.
Publicado: (2023)
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025)
por: Quan, Guofeng, et al.
Publicado: (2025)
The Disparate Impacts of Speculative Decoding
por: Sandler, Jameson, et al.
Publicado: (2025)
por: Sandler, Jameson, et al.
Publicado: (2025)
Speculative Decoding: Performance or Illusion?
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
Mamba Drafters for Speculative Decoding
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Constrained Decoding with Speculative Lookaheads
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
por: Jin, Tao, et al.
Publicado: (2026)
por: Jin, Tao, et al.
Publicado: (2026)
Batch Speculative Decoding Done Right
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
por: Yoon, Kanghoon, et al.
Publicado: (2025)
por: Yoon, Kanghoon, et al.
Publicado: (2025)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
por: Su, Xin, et al.
Publicado: (2026)
por: Su, Xin, et al.
Publicado: (2026)
OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
por: Lee, Jaeseong, et al.
Publicado: (2025)
por: Lee, Jaeseong, et al.
Publicado: (2025)
RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
por: Zhang, Zihong, et al.
Publicado: (2026)
por: Zhang, Zihong, et al.
Publicado: (2026)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
por: Fang, Min, et al.
Publicado: (2025)
por: Fang, Min, et al.
Publicado: (2025)
On Speculative Decoding for Multimodal Large Language Models
por: Gagrani, Mukul, et al.
Publicado: (2024)
por: Gagrani, Mukul, et al.
Publicado: (2024)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
por: Wang, Ziyao, et al.
Publicado: (2025)
por: Wang, Ziyao, et al.
Publicado: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025)
por: Li, Guanghao, et al.
Publicado: (2025)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
por: Zhang, Situo, et al.
Publicado: (2026)
por: Zhang, Situo, et al.
Publicado: (2026)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
Acceptance Dynamics Across Cognitive Domains in Speculative Decoding
por: Mahmoud, Saif
Publicado: (2026)
por: Mahmoud, Saif
Publicado: (2026)
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
SAM Decoding: Speculative Decoding via Suffix Automaton
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
por: Su, Tiancheng, et al.
Publicado: (2025)
por: Su, Tiancheng, et al.
Publicado: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)
por: Sun, Ryan, et al.
Publicado: (2024)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Faster Cascades via Speculative Decoding
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
Self-Speculative Biased Decoding for Faster Re-Translation
por: Zeng, Linxiao, et al.
Publicado: (2025)
por: Zeng, Linxiao, et al.
Publicado: (2025)
CREST: Effectively Compacting a Datastore For Retrieval-Based Speculative Decoding
por: Ho, Sophia, et al.
Publicado: (2024)
por: Ho, Sophia, et al.
Publicado: (2024)
EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation
por: Zhang, Shuyu, et al.
Publicado: (2026)
por: Zhang, Shuyu, et al.
Publicado: (2026)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
por: Zhang, Situo, et al.
Publicado: (2024)
por: Zhang, Situo, et al.
Publicado: (2024)
Ejemplares similares
-
SMaRT: Select, Mix, and ReinvenT -- A Strategy Fusion Framework for LLM-Driven Reasoning and Planning
por: Verma, Nikhil, et al.
Publicado: (2025) -
S3D: A Simple and Cost-Effective Self-Speculative Decoding Scheme for Low-Memory GPUs
por: Zhong, Wei, et al.
Publicado: (2024) -
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024) -
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025) -
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)