A Multi-Model Adaptation of Speculative Decoding for Classification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Roy, Somnath, Sreekar, Padharthi, Narasimha, Srivatsa, Anand, Anubhav |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
par: Gautam, Aayush, et autres
Publié: (2025)
par: Gautam, Aayush, et autres
Publié: (2025)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
par: Mamou, Jonathan, et autres
Publié: (2024)
par: Mamou, Jonathan, et autres
Publié: (2024)
Multi-Candidate Speculative Decoding
par: Yang, Sen, et autres
Publié: (2024)
par: Yang, Sen, et autres
Publié: (2024)
Improving Multi-candidate Speculative Decoding
par: Lu, Xiaofan, et autres
Publié: (2024)
par: Lu, Xiaofan, et autres
Publié: (2024)
3-Model Speculative Decoding
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
Constrained Decoding with Speculative Lookaheads
par: Nakshatri, Nishanth, et autres
Publié: (2024)
par: Nakshatri, Nishanth, et autres
Publié: (2024)
Speculative Decoding with a Speculative Vocabulary
par: Williams, Miles, et autres
Publié: (2026)
par: Williams, Miles, et autres
Publié: (2026)
Multi-Drafter Speculative Decoding with Alignment Feedback
par: Kim, Taehyeon, et autres
Publié: (2026)
par: Kim, Taehyeon, et autres
Publié: (2026)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
Speculative Decoding for Multi-Sample Inference
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Speculative Contrastive Decoding
par: Yuan, Hongyi, et autres
Publié: (2023)
par: Yuan, Hongyi, et autres
Publié: (2023)
Accelerating Production LLMs with Combined Token/Embedding Speculators
par: Wertheimer, Davis, et autres
Publié: (2024)
par: Wertheimer, Davis, et autres
Publié: (2024)
Graph-Structured Speculative Decoding
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
par: Lv, Kai, et autres
Publié: (2025)
par: Lv, Kai, et autres
Publié: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
par: Ganesan, Mugilan, et autres
Publié: (2025)
par: Ganesan, Mugilan, et autres
Publié: (2025)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
par: Kim, Sungkyun, et autres
Publié: (2025)
par: Kim, Sungkyun, et autres
Publié: (2025)
Towards Optimal Multi-draft Speculative Decoding
par: Hu, Zhengmian, et autres
Publié: (2025)
par: Hu, Zhengmian, et autres
Publié: (2025)
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
par: Ni, Yunsheng, et autres
Publié: (2024)
par: Ni, Yunsheng, et autres
Publié: (2024)
Self Speculative Decoding for Diffusion Large Language Models
par: Gao, Yifeng, et autres
Publié: (2025)
par: Gao, Yifeng, et autres
Publié: (2025)
EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation
par: Zhang, Shuyu, et autres
Publié: (2026)
par: Zhang, Shuyu, et autres
Publié: (2026)
The Disparate Impacts of Speculative Decoding
par: Sandler, Jameson, et autres
Publié: (2025)
par: Sandler, Jameson, et autres
Publié: (2025)
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
Cross-Attention Speculative Decoding
par: Zhong, Wei, et autres
Publié: (2025)
par: Zhong, Wei, et autres
Publié: (2025)
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)
par: Liu, Xiaoxuan, et autres
Publié: (2025)
Mamba Drafters for Speculative Decoding
par: Choi, Daewon, et autres
Publié: (2025)
par: Choi, Daewon, et autres
Publié: (2025)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024)
par: Sun, Ryan, et autres
Publié: (2024)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
par: Jin, Tao, et autres
Publié: (2026)
par: Jin, Tao, et autres
Publié: (2026)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
par: Lin, Yijun, et autres
Publié: (2026)
par: Lin, Yijun, et autres
Publié: (2026)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
UniVer: A Unified Perspective for Multi-step and Multi-draft Speculative Decoding
par: Weng, Yepeng, et autres
Publié: (2026)
par: Weng, Yepeng, et autres
Publié: (2026)
Speculative Decoding and Beyond: An In-Depth Survey of Techniques
par: Hu, Yunhai, et autres
Publié: (2025)
par: Hu, Yunhai, et autres
Publié: (2025)
DReSD: Dense Retrieval for Speculative Decoding
par: Gritta, Milan, et autres
Publié: (2025)
par: Gritta, Milan, et autres
Publié: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
par: Wang, Jikai, et autres
Publié: (2025)
par: Wang, Jikai, et autres
Publié: (2025)
SPEED: Speculative Pipelined Execution for Efficient Decoding
par: Hooper, Coleman, et autres
Publié: (2023)
par: Hooper, Coleman, et autres
Publié: (2023)
DFlash: Block Diffusion for Flash Speculative Decoding
par: Chen, Jian, et autres
Publié: (2026)
par: Chen, Jian, et autres
Publié: (2026)
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
par: Yu, Yijiong, et autres
Publié: (2026)
par: Yu, Yijiong, et autres
Publié: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
par: Brown, Oscar, et autres
Publié: (2024)
par: Brown, Oscar, et autres
Publié: (2024)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
par: Lu, Kuan-Wei, et autres
Publié: (2025)
par: Lu, Kuan-Wei, et autres
Publié: (2025)
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
par: Huang, Jianuo, et autres
Publié: (2026)
par: Huang, Jianuo, et autres
Publié: (2026)
Documents similaires
-
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
par: Gautam, Aayush, et autres
Publié: (2025) -
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
par: Mamou, Jonathan, et autres
Publié: (2024) -
Multi-Candidate Speculative Decoding
par: Yang, Sen, et autres
Publié: (2024) -
Improving Multi-candidate Speculative Decoding
par: Lu, Xiaofan, et autres
Publié: (2024) -
3-Model Speculative Decoding
par: Byun, Sanghyun, et autres
Publié: (2025)