LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Elhoushi, Mostafa, Shrivastava, Akshat, Liskovich, Diana, Hosmer, Basil, Wasti, Bram, Lai, Liangzhen, Mahmoud, Anas, Acun, Bilge, Agarwal, Saurabh, Roman, Ahmed, Aly, Ahmed A, Chen, Beidi, Wu, Carole-Jean |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CHAI: Clustered Head Attention for Efficient LLM Inference
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
Scalable LLM Reasoning Acceleration with Low-rank Distillation
di: Dong, Harry, et al.
Pubblicazione: (2025)
di: Dong, Harry, et al.
Pubblicazione: (2025)
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024)
di: Yan, Minghao, et al.
Pubblicazione: (2024)
CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
di: Wang, Irene, et al.
Pubblicazione: (2025)
di: Wang, Irene, et al.
Pubblicazione: (2025)
Is Flash Attention Stable?
di: Golden, Alicia, et al.
Pubblicazione: (2024)
di: Golden, Alicia, et al.
Pubblicazione: (2024)
Generative AI Beyond LLMs: System Implications of Multi-Modal Generation
di: Golden, Alicia, et al.
Pubblicazione: (2023)
di: Golden, Alicia, et al.
Pubblicazione: (2023)
Beyond Efficiency: Scaling AI Sustainably
di: Wu, Carole-Jean, et al.
Pubblicazione: (2024)
di: Wu, Carole-Jean, et al.
Pubblicazione: (2024)
CoSMoEs: Compact Sparse Mixture of Experts
di: Huber, Patrick, et al.
Pubblicazione: (2025)
di: Huber, Patrick, et al.
Pubblicazione: (2025)
Unlocking the Potential of Renewable Energy Through Curtailment Prediction
di: Acun, Bilge, et al.
Pubblicazione: (2024)
di: Acun, Bilge, et al.
Pubblicazione: (2024)
any4: Learned 4-bit Numeric Representation for LLMs
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2025)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2025)
Sieve: Multimodal Dataset Pruning Using Image Captioning Models
di: Mahmoud, Anas, et al.
Pubblicazione: (2023)
di: Mahmoud, Anas, et al.
Pubblicazione: (2023)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
di: Chen, Longze, et al.
Pubblicazione: (2025)
di: Chen, Longze, et al.
Pubblicazione: (2025)
Small But Funny: A Feedback-Driven Approach to Humor Distillation
di: Ravi, Sahithya, et al.
Pubblicazione: (2024)
di: Ravi, Sahithya, et al.
Pubblicazione: (2024)
Fast and Cost-effective Speculative Edge-Cloud Decoding with Early Exits
di: Venkatesha, Yeshwanth, et al.
Pubblicazione: (2025)
di: Venkatesha, Yeshwanth, et al.
Pubblicazione: (2025)
Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding
di: Chen, Zhuoming, et al.
Pubblicazione: (2024)
di: Chen, Zhuoming, et al.
Pubblicazione: (2024)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
di: Amer, Walaa, et al.
Pubblicazione: (2026)
di: Amer, Walaa, et al.
Pubblicazione: (2026)
Acceptance Dynamics Across Cognitive Domains in Speculative Decoding
di: Mahmoud, Saif
Pubblicazione: (2026)
di: Mahmoud, Saif
Pubblicazione: (2026)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
di: Li, Minghan, et al.
Pubblicazione: (2024)
di: Li, Minghan, et al.
Pubblicazione: (2024)
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
di: Hegazy, Amr, et al.
Pubblicazione: (2025)
di: Hegazy, Amr, et al.
Pubblicazione: (2025)
AST-T5: Structure-Aware Pretraining for Code Generation and Understanding
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
Accelerating genetic optimization of nonlinear model predictive control by learning optimal search space size
di: Mostafa, Eslam, et al.
Pubblicazione: (2023)
di: Mostafa, Eslam, et al.
Pubblicazione: (2023)
VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping
di: Dong, Haotian, et al.
Pubblicazione: (2025)
di: Dong, Haotian, et al.
Pubblicazione: (2025)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
di: Svirschevski, Ruslan, et al.
Pubblicazione: (2024)
di: Svirschevski, Ruslan, et al.
Pubblicazione: (2024)
Hosmer, Susan C Feb. 18, 1915 [Postcard]
di: Hosmer, Susan C
Pubblicazione: (1915)
di: Hosmer, Susan C
Pubblicazione: (1915)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
di: Yang, Rubing, et al.
Pubblicazione: (2025)
di: Yang, Rubing, et al.
Pubblicazione: (2025)
Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
di: Li, Ruanjun, et al.
Pubblicazione: (2025)
di: Li, Ruanjun, et al.
Pubblicazione: (2025)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
di: Le, Trang, et al.
Pubblicazione: (2024)
di: Le, Trang, et al.
Pubblicazione: (2024)
CoDi: Conversational Distillation for Grounded Question Answering
di: Huber, Patrick, et al.
Pubblicazione: (2024)
di: Huber, Patrick, et al.
Pubblicazione: (2024)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
BitSkip: An Empirical Analysis of Quantization and Early Exit Composition in Transformers
di: Bhuvaneswaran, Ramshankar, et al.
Pubblicazione: (2025)
di: Bhuvaneswaran, Ramshankar, et al.
Pubblicazione: (2025)
Speculative Speculative Decoding
di: Kumar, Tanishq, et al.
Pubblicazione: (2026)
di: Kumar, Tanishq, et al.
Pubblicazione: (2026)
Structure-Aware Fill-in-the-Middle Pretraining for Code
di: Gong, Linyuan, et al.
Pubblicazione: (2025)
di: Gong, Linyuan, et al.
Pubblicazione: (2025)
Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM
di: Chimoto, Everlyn Asiko, et al.
Pubblicazione: (2026)
di: Chimoto, Everlyn Asiko, et al.
Pubblicazione: (2026)
CORRELATES OF ANTENATAL BODY MASS INDEX (BMI) AS A DETERMINANT OF BIRTH WEIGHT - A LONGITUDINAL STUDY
di: Saurabh Rambiharilal Shrivastava
Pubblicazione: (2012)
di: Saurabh Rambiharilal Shrivastava
Pubblicazione: (2012)
Enhancing Gluten‐Free Cake Quality With Germinated and Ungerminated Mung Bean Flours: A Comparative Analysis
di: Sultan Acun
Pubblicazione: (2026)
di: Sultan Acun
Pubblicazione: (2026)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
di: Tang, Bangsheng, et al.
Pubblicazione: (2025)
di: Tang, Bangsheng, et al.
Pubblicazione: (2025)
Letter to the Editor in Response to “Association between severity of diabetic complications and risk of cancer in middle‐aged patients with type 2 diabetes”
di: Syeda Aamna Wasti
Pubblicazione: (2025)
di: Syeda Aamna Wasti
Pubblicazione: (2025)
Documenti analoghi
-
CHAI: Clustered Head Attention for Efficient LLM Inference
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024) -
Scalable LLM Reasoning Acceleration with Low-rank Distillation
di: Dong, Harry, et al.
Pubblicazione: (2025) -
Decoding Speculative Decoding
di: Yan, Minghao, et al.
Pubblicazione: (2024) -
CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
di: Wang, Irene, et al.
Pubblicazione: (2025) -
Is Flash Attention Stable?
di: Golden, Alicia, et al.
Pubblicazione: (2024)