KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem
Fuente:
arXiv
Salvato in:
| Autori principali: | Cha, Seongjin, Kim, Gyuwan, Han, Dongsu, Yang, Tao, Han, Insu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
di: Hou, Yunlong, et al.
Pubblicazione: (2025)
di: Hou, Yunlong, et al.
Pubblicazione: (2025)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
di: Wen, Zhuofan, et al.
Pubblicazione: (2026)
di: Wen, Zhuofan, et al.
Pubblicazione: (2026)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences
di: Cha, Jungyoub, et al.
Pubblicazione: (2025)
di: Cha, Jungyoub, et al.
Pubblicazione: (2025)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
di: Bang, Jehyeon, et al.
Pubblicazione: (2026)
di: Bang, Jehyeon, et al.
Pubblicazione: (2026)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
di: Shukla, Shikhar
Pubblicazione: (2026)
di: Shukla, Shikhar
Pubblicazione: (2026)
SpecMemo: Speculative Decoding is in Your Pocket
di: Yildirim, Selin, et al.
Pubblicazione: (2025)
di: Yildirim, Selin, et al.
Pubblicazione: (2025)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
di: Wang, Songsheng, et al.
Pubblicazione: (2025)
di: Wang, Songsheng, et al.
Pubblicazione: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
di: Yang, Penghui, et al.
Pubblicazione: (2025)
di: Yang, Penghui, et al.
Pubblicazione: (2025)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
di: Li, Shenggui, et al.
Pubblicazione: (2026)
di: Li, Shenggui, et al.
Pubblicazione: (2026)
SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning
di: Pan, Rui, et al.
Pubblicazione: (2025)
di: Pan, Rui, et al.
Pubblicazione: (2025)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
di: Yang, Rubing, et al.
Pubblicazione: (2025)
di: Yang, Rubing, et al.
Pubblicazione: (2025)
SpecMD: A Comprehensive Study On Speculative Expert Prefetching
di: Hoang, Duc, et al.
Pubblicazione: (2026)
di: Hoang, Duc, et al.
Pubblicazione: (2026)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
di: Zhao, Yilong, et al.
Pubblicazione: (2025)
di: Zhao, Yilong, et al.
Pubblicazione: (2025)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
di: Xu, Yuhang, et al.
Pubblicazione: (2026)
di: Xu, Yuhang, et al.
Pubblicazione: (2026)
Energy-Efficient Wireless LLM Inference via Uncertainty and Importance-Aware Speculative Decoding
di: Park, Jihoon, et al.
Pubblicazione: (2025)
di: Park, Jihoon, et al.
Pubblicazione: (2025)
Speculative Safety-Aware Decoding
di: Wang, Xuekang, et al.
Pubblicazione: (2025)
di: Wang, Xuekang, et al.
Pubblicazione: (2025)
AcuRank: Uncertainty-Aware Adaptive Computation for Listwise Reranking
di: Yoon, Soyoung, et al.
Pubblicazione: (2025)
di: Yoon, Soyoung, et al.
Pubblicazione: (2025)
TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
di: Li, Ye, et al.
Pubblicazione: (2025)
di: Li, Ye, et al.
Pubblicazione: (2025)
CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration
di: Han, Yuning, et al.
Pubblicazione: (2026)
di: Han, Yuning, et al.
Pubblicazione: (2026)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
Detecting Training Data of Large Language Models via Expectation Maximization
di: Kim, Gyuwan, et al.
Pubblicazione: (2024)
di: Kim, Gyuwan, et al.
Pubblicazione: (2024)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
di: Zandieh, Amir, et al.
Pubblicazione: (2024)
di: Zandieh, Amir, et al.
Pubblicazione: (2024)
When Drafts Evolve: Speculative Decoding Meets Online Learning
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
di: Qian, Yu-Yang, et al.
Pubblicazione: (2026)
QSpec: Speculative Decoding with Complementary Quantization Schemes
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
Multi-agent Coordination via Flow Matching
di: Lee, Dongsu, et al.
Pubblicazione: (2025)
di: Lee, Dongsu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
di: Hou, Yunlong, et al.
Pubblicazione: (2025) -
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
di: Wen, Zhuofan, et al.
Pubblicazione: (2026) -
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025) -
SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences
di: Cha, Jungyoub, et al.
Pubblicazione: (2025) -
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)