QSpec: Speculative Decoding with Complementary Quantization Schemes
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Juntao, Lu, Wenhao, Wang, Sheng, Kong, Lingpeng, Wu, Chuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
Scaling Reasoning without Attention
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
Speculative Safety-Aware Decoding
di: Wang, Xuekang, et al.
Pubblicazione: (2025)
di: Wang, Xuekang, et al.
Pubblicazione: (2025)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
When Drafts Evolve: Speculative Decoding Meets Online Learning
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
di: Shen, Yuhao, et al.
Pubblicazione: (2026)
di: Shen, Yuhao, et al.
Pubblicazione: (2026)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
TreeSynth: Synthesizing Diverse Data from Scratch via Tree-Guided Subspace Partitioning
di: Wang, Sheng, et al.
Pubblicazione: (2025)
di: Wang, Sheng, et al.
Pubblicazione: (2025)
STree: Speculative Tree Decoding for Hybrid State-Space Models
di: Wu, Yangchao, et al.
Pubblicazione: (2025)
di: Wu, Yangchao, et al.
Pubblicazione: (2025)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Representation Collapsing Problems in Vector Quantization
di: Zhao, Wenhao, et al.
Pubblicazione: (2024)
di: Zhao, Wenhao, et al.
Pubblicazione: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
di: Wang, Songsheng, et al.
Pubblicazione: (2025)
di: Wang, Songsheng, et al.
Pubblicazione: (2025)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
di: Hou, Yunlong, et al.
Pubblicazione: (2025)
di: Hou, Yunlong, et al.
Pubblicazione: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
di: Zhao, Yilong, et al.
Pubblicazione: (2025)
di: Zhao, Yilong, et al.
Pubblicazione: (2025)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
di: Li, Ye, et al.
Pubblicazione: (2025)
di: Li, Ye, et al.
Pubblicazione: (2025)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization
di: Zhao, Wenhao, et al.
Pubblicazione: (2026)
di: Zhao, Wenhao, et al.
Pubblicazione: (2026)
BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding
di: He, Liang, et al.
Pubblicazione: (2026)
di: He, Liang, et al.
Pubblicazione: (2026)
On Speculative Decoding for Multimodal Large Language Models
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
di: Gagrani, Mukul, et al.
Pubblicazione: (2024)
Benchmarking the Energy Savings with Speculative Decoding Strategies
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
di: Dutta, Rohit, et al.
Pubblicazione: (2026)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models
di: Xie, Zhinan, et al.
Pubblicazione: (2025)
di: Xie, Zhinan, et al.
Pubblicazione: (2025)
Implicit Search via Discrete Diffusion: A Study on Chess
di: Ye, Jiacheng, et al.
Pubblicazione: (2025)
di: Ye, Jiacheng, et al.
Pubblicazione: (2025)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
di: Jeon, Wonseok, et al.
Pubblicazione: (2024)
di: Jeon, Wonseok, et al.
Pubblicazione: (2024)
MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
di: Huang, Zongle, et al.
Pubblicazione: (2025)
di: Huang, Zongle, et al.
Pubblicazione: (2025)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
di: Xiao, Bin, et al.
Pubblicazione: (2024)
di: Xiao, Bin, et al.
Pubblicazione: (2024)
Confidence-Modulated Speculative Decoding for Large Language Models
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
di: Sen, Jaydip, et al.
Pubblicazione: (2025)
Energy-Efficient Wireless LLM Inference via Uncertainty and Importance-Aware Speculative Decoding
di: Park, Jihoon, et al.
Pubblicazione: (2025)
di: Park, Jihoon, et al.
Pubblicazione: (2025)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
BioMaze: Benchmarking and Enhancing Large Language Models for Biological Pathway Reasoning
di: Zhao, Haiteng, et al.
Pubblicazione: (2025)
di: Zhao, Haiteng, et al.
Pubblicazione: (2025)
REST: Retrieval-Based Speculative Decoding
di: He, Zhenyu, et al.
Pubblicazione: (2023)
di: He, Zhenyu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
di: Zhang, Yudi, et al.
Pubblicazione: (2025) -
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025) -
Scaling Reasoning without Attention
di: Zhao, Xueliang, et al.
Pubblicazione: (2025) -
Speculative Safety-Aware Decoding
di: Wang, Xuekang, et al.
Pubblicazione: (2025) -
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)