S3D: A Simple and Cost-Effective Self-Speculative Decoding Scheme for Low-Memory GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Wei, Bharadwaj, Manasa |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Attention Speculative Decoding
par: Zhong, Wei, et autres
Publié: (2025)
par: Zhong, Wei, et autres
Publié: (2025)
The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context
par: Verma, Nikhil, et autres
Publié: (2025)
par: Verma, Nikhil, et autres
Publié: (2025)
GPT-DETOX: An In-Context Learning-Based Paraphraser for Text Detoxification
par: Pesaranghader, Ali, et autres
Publié: (2024)
par: Pesaranghader, Ali, et autres
Publié: (2024)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
par: Zhang, Shuai, et autres
Publié: (2026)
par: Zhang, Shuai, et autres
Publié: (2026)
3-Model Speculative Decoding
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
par: Ma, Zhiyao, et autres
Publié: (2025)
par: Ma, Zhiyao, et autres
Publié: (2025)
Speculative Decoding with a Speculative Vocabulary
par: Williams, Miles, et autres
Publié: (2026)
par: Williams, Miles, et autres
Publié: (2026)
Self Speculative Decoding for Diffusion Large Language Models
par: Gao, Yifeng, et autres
Publié: (2025)
par: Gao, Yifeng, et autres
Publié: (2025)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
par: Hu, Shijing, et autres
Publié: (2025)
par: Hu, Shijing, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
Speculative Contrastive Decoding
par: Yuan, Hongyi, et autres
Publié: (2023)
par: Yuan, Hongyi, et autres
Publié: (2023)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
par: Xia, Heming, et autres
Publié: (2024)
par: Xia, Heming, et autres
Publié: (2024)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
par: Chen, Longze, et autres
Publié: (2025)
par: Chen, Longze, et autres
Publié: (2025)
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation
par: Han, Ligong, et autres
Publié: (2026)
par: Han, Ligong, et autres
Publié: (2026)
Temperature-Centric Investigation of Speculative Decoding with Knowledge Distillation
par: Ouyang, Siru, et autres
Publié: (2024)
par: Ouyang, Siru, et autres
Publié: (2024)
Speculative Decoding Scaling Laws (SDSL): Throughput Optimization Made Simple
par: Bozorgkhoo, Amirhossein, et autres
Publié: (2026)
par: Bozorgkhoo, Amirhossein, et autres
Publié: (2026)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
par: Metel, Michael R., et autres
Publié: (2024)
par: Metel, Michael R., et autres
Publié: (2024)
Multi-Candidate Speculative Decoding
par: Yang, Sen, et autres
Publié: (2024)
par: Yang, Sen, et autres
Publié: (2024)
Graph-Structured Speculative Decoding
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
par: Kim, Sungkyun, et autres
Publié: (2025)
par: Kim, Sungkyun, et autres
Publié: (2025)
Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively
par: Gu, Jiawei, et autres
Publié: (2025)
par: Gu, Jiawei, et autres
Publié: (2025)
Dynamic Speculation Lookahead Accelerates Speculative Decoding of Large Language Models
par: Mamou, Jonathan, et autres
Publié: (2024)
par: Mamou, Jonathan, et autres
Publié: (2024)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
par: Yoon, Kanghoon, et autres
Publié: (2025)
par: Yoon, Kanghoon, et autres
Publié: (2025)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
par: Liu, Fuliang, et autres
Publié: (2026)
par: Liu, Fuliang, et autres
Publié: (2026)
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025)
par: Zeng, Linxiao, et autres
Publié: (2025)
CREST: Effectively Compacting a Datastore For Retrieval-Based Speculative Decoding
par: Ho, Sophia, et autres
Publié: (2024)
par: Ho, Sophia, et autres
Publié: (2024)
Improving Multi-candidate Speculative Decoding
par: Lu, Xiaofan, et autres
Publié: (2024)
par: Lu, Xiaofan, et autres
Publié: (2024)
GliDe with a CaPE: A Low-Hassle Method to Accelerate Speculative Decoding
par: Du, Cunxiao, et autres
Publié: (2024)
par: Du, Cunxiao, et autres
Publié: (2024)
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)
par: He, Zhenyu, et autres
Publié: (2023)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
par: Liu, Fangcheng, et autres
Publié: (2024)
par: Liu, Fangcheng, et autres
Publié: (2024)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
par: Zhang, Jun, et autres
Publié: (2023)
par: Zhang, Jun, et autres
Publié: (2023)
Constrained Decoding with Speculative Lookaheads
par: Nakshatri, Nishanth, et autres
Publié: (2024)
par: Nakshatri, Nishanth, et autres
Publié: (2024)
The Disparate Impacts of Speculative Decoding
par: Sandler, Jameson, et autres
Publié: (2025)
par: Sandler, Jameson, et autres
Publié: (2025)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
Scaling Laws for Speculative Decoding
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
Speculative Decoding: Performance or Illusion?
par: Liu, Xiaoxuan, et autres
Publié: (2025)
par: Liu, Xiaoxuan, et autres
Publié: (2025)
Mamba Drafters for Speculative Decoding
par: Choi, Daewon, et autres
Publié: (2025)
par: Choi, Daewon, et autres
Publié: (2025)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
par: Jin, Tao, et autres
Publié: (2026)
par: Jin, Tao, et autres
Publié: (2026)
Documents similaires
-
Cross-Attention Speculative Decoding
par: Zhong, Wei, et autres
Publié: (2025) -
The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context
par: Verma, Nikhil, et autres
Publié: (2025) -
GPT-DETOX: An In-Context Learning-Based Paraphraser for Text Detoxification
par: Pesaranghader, Ali, et autres
Publié: (2024) -
Cost-Aware Diffusion Draft Trees for Speculative Decoding
par: Zhang, Shuai, et autres
Publié: (2026) -
3-Model Speculative Decoding
par: Byun, Sanghyun, et autres
Publié: (2025)