DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zarch, Hossein Entezari, Gao, Lei, Jiang, Chaoyi, Annavaram, Murali |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputation
par: Jiang, Chaoyi, et autres
Publié: (2024)
par: Jiang, Chaoyi, et autres
Publié: (2024)
DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing
par: Gao, Lei, et autres
Publié: (2025)
par: Gao, Lei, et autres
Publié: (2025)
CADC: Encoding User-Item Interactions for Compressing Recommendation Model Training Data
par: Zarch, Hossein Entezari, et autres
Publié: (2024)
par: Zarch, Hossein Entezari, et autres
Publié: (2024)
MARché: Fast Masked Autoregressive Image Generation with Cache-Aware Attention
par: Jiang, Chaoyi, et autres
Publié: (2025)
par: Jiang, Chaoyi, et autres
Publié: (2025)
Striking the Right Balance between Compute and Copy: Improving LLM Inferencing Under Speculative Decoding
par: Ramachandran, Arun, et autres
Publié: (2025)
par: Ramachandran, Arun, et autres
Publié: (2025)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
par: Elhoushi, Mostafa, et autres
Publié: (2024)
par: Elhoushi, Mostafa, et autres
Publié: (2024)
Differentially Private Knowledge Distillation via Synthetic Text Generation
par: Flemings, James, et autres
Publié: (2024)
par: Flemings, James, et autres
Publié: (2024)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
par: Amer, Walaa, et autres
Publié: (2026)
par: Amer, Walaa, et autres
Publié: (2026)
Differentially Private Next-Token Prediction of Large Language Models
par: Flemings, James, et autres
Publié: (2024)
par: Flemings, James, et autres
Publié: (2024)
Estimating Privacy Leakage of Augmented Contextual Knowledge in Language Models
par: Flemings, James, et autres
Publié: (2024)
par: Flemings, James, et autres
Publié: (2024)
RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
par: Hoshino, Yuichiro, et autres
Publié: (2025)
par: Hoshino, Yuichiro, et autres
Publié: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
par: Yang, Rubing, et autres
Publié: (2025)
par: Yang, Rubing, et autres
Publié: (2025)
LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference
par: Kapadia, Shashank, et autres
Publié: (2026)
par: Kapadia, Shashank, et autres
Publié: (2026)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
par: Zhou, Xuwen, et autres
Publié: (2026)
par: Zhou, Xuwen, et autres
Publié: (2026)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
par: Ziashahabi, Amir, et autres
Publié: (2025)
par: Ziashahabi, Amir, et autres
Publié: (2025)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
Fast NF4 Dequantization Kernels for Large Language Model Inference
par: Qi, Xiangbo, et autres
Publié: (2026)
par: Qi, Xiangbo, et autres
Publié: (2026)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
par: Liu, Fangcheng, et autres
Publié: (2024)
par: Liu, Fangcheng, et autres
Publié: (2024)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
TapOut: A Bandit-Based Approach to Dynamic Speculative Decoding
par: Sridhar, Aditya, et autres
Publié: (2025)
par: Sridhar, Aditya, et autres
Publié: (2025)
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025)
par: Zeng, Linxiao, et autres
Publié: (2025)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
par: Gui, Lujun, et autres
Publié: (2024)
par: Gui, Lujun, et autres
Publié: (2024)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
par: Timor, Nadav, et autres
Publié: (2025)
par: Timor, Nadav, et autres
Publié: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)
par: Hu, Yuezhou, et autres
Publié: (2025)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
MobiZO: Enabling Efficient LLM Fine-Tuning at the Edge via Inference Engines
par: Gao, Lei, et autres
Publié: (2024)
par: Gao, Lei, et autres
Publié: (2024)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
par: Yang, Ning, et autres
Publié: (2025)
par: Yang, Ning, et autres
Publié: (2025)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
par: Ryu, Hyun, et autres
Publié: (2024)
par: Ryu, Hyun, et autres
Publié: (2024)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
par: Li, Shenggui, et autres
Publié: (2026)
par: Li, Shenggui, et autres
Publié: (2026)
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
par: Maheswaran, Monishwaran, et autres
Publié: (2025)
par: Maheswaran, Monishwaran, et autres
Publié: (2025)
Documents similaires
-
DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning
par: Zarch, Hossein Entezari, et autres
Publié: (2025) -
KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputation
par: Jiang, Chaoyi, et autres
Publié: (2024) -
DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing
par: Gao, Lei, et autres
Publié: (2025) -
CADC: Encoding User-Item Interactions for Compressing Recommendation Model Training Data
par: Zarch, Hossein Entezari, et autres
Publié: (2024) -
MARché: Fast Masked Autoregressive Image Generation with Cache-Aware Attention
par: Jiang, Chaoyi, et autres
Publié: (2025)