Overcoming Joint Intractability with Lossless Hierarchical Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yuxuan, Huang, Fei, Li, Heng, Wu, Fengyi, Wang, Tianyu, Zhang, Jianwei, Lin, Junyang, Cheng, Zhi-Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025)
por: Yang, Penghui, et al.
Publicado: (2025)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
por: Ning, Zhiyuan, et al.
Publicado: (2025)
por: Ning, Zhiyuan, et al.
Publicado: (2025)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
MaxSup: Overcoming Representation Collapse in Label Smoothing
por: Zhou, Yuxuan, et al.
Publicado: (2025)
por: Zhou, Yuxuan, et al.
Publicado: (2025)
SAM Decoding: Speculative Decoding via Suffix Automaton
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
por: Lee, Jaeseong, et al.
Publicado: (2025)
por: Lee, Jaeseong, et al.
Publicado: (2025)
Batch Speculative Decoding Done Right
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
Speculative Safety-Aware Decoding
por: Wang, Xuekang, et al.
Publicado: (2025)
por: Wang, Xuekang, et al.
Publicado: (2025)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
por: Lv, Qitan, et al.
Publicado: (2026)
por: Lv, Qitan, et al.
Publicado: (2026)
HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and Continuous Environments with Dynamic Multi-Human Interactions
por: Dong, Yifei, et al.
Publicado: (2025)
por: Dong, Yifei, et al.
Publicado: (2025)
MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
por: Huang, Zongle, et al.
Publicado: (2025)
por: Huang, Zongle, et al.
Publicado: (2025)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
por: Hou, Yunlong, et al.
Publicado: (2025)
por: Hou, Yunlong, et al.
Publicado: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
por: Tiwari, Rishabh, et al.
Publicado: (2025)
por: Tiwari, Rishabh, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
por: Zhang, Yudi, et al.
Publicado: (2025)
por: Zhang, Yudi, et al.
Publicado: (2025)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
por: Wu, Shutong, et al.
Publicado: (2025)
por: Wu, Shutong, et al.
Publicado: (2025)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
por: Shen, Yuhao, et al.
Publicado: (2026)
por: Shen, Yuhao, et al.
Publicado: (2026)
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
Lossless Model Compression via Joint Low-Rank Factorization Optimization
por: Zhang, Boyang, et al.
Publicado: (2024)
por: Zhang, Boyang, et al.
Publicado: (2024)
Fuzzy Speculative Decoding for a Tunable Accuracy-Runtime Tradeoff
por: Holsman, Maximilian, et al.
Publicado: (2025)
por: Holsman, Maximilian, et al.
Publicado: (2025)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
por: Zhang, Zihong, et al.
Publicado: (2026)
por: Zhang, Zihong, et al.
Publicado: (2026)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025)
por: Quan, Guofeng, et al.
Publicado: (2025)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
por: Wu, Zhaoxuan, et al.
Publicado: (2025)
QSpec: Speculative Decoding with Complementary Quantization Schemes
por: Zhao, Juntao, et al.
Publicado: (2024)
por: Zhao, Juntao, et al.
Publicado: (2024)
The Disparate Impacts of Speculative Decoding
por: Sandler, Jameson, et al.
Publicado: (2025)
por: Sandler, Jameson, et al.
Publicado: (2025)
Constrained Decoding with Speculative Lookaheads
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
por: Nakshatri, Nishanth, et al.
Publicado: (2024)
Cross-Attention Speculative Decoding
por: Zhong, Wei, et al.
Publicado: (2025)
por: Zhong, Wei, et al.
Publicado: (2025)
Speculative Decoding: Performance or Illusion?
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
por: Liu, Xiaoxuan, et al.
Publicado: (2025)
Mamba Drafters for Speculative Decoding
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Speculative Actions: A Lossless Framework for Faster Agentic Systems
por: Ye, Naimeng, et al.
Publicado: (2025)
por: Ye, Naimeng, et al.
Publicado: (2025)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
por: Jin, Tao, et al.
Publicado: (2026)
por: Jin, Tao, et al.
Publicado: (2026)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
Reinforcement Speculative Decoding for Fast Ranking
por: Du, Yingpeng, et al.
Publicado: (2025)
por: Du, Yingpeng, et al.
Publicado: (2025)
Ejemplares similares
-
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025) -
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
por: Ning, Zhiyuan, et al.
Publicado: (2025) -
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
por: Agrawal, Sudhanshu, et al.
Publicado: (2025) -
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025) -
MaxSup: Overcoming Representation Collapse in Label Smoothing
por: Zhou, Yuxuan, et al.
Publicado: (2025)