SENSE: Semantic Embedding Navigation with Soft-gated Evaluation for Retrieval-based Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Shaowen, Liao, Zhicheng, Wang, Hongwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
REST: Retrieval-Based Speculative Decoding
por: He, Zhenyu, et al.
Publicado: (2023)
por: He, Zhenyu, et al.
Publicado: (2023)
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024)
por: Zimmer, Matthieu, et al.
Publicado: (2024)
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
por: Liu, Xiaoxuan, et al.
Publicado: (2023)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
por: Zhang, Yudi, et al.
Publicado: (2025)
por: Zhang, Yudi, et al.
Publicado: (2025)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Faster Cascades via Speculative Decoding
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
por: Narasimhan, Harikrishna, et al.
Publicado: (2024)
Self-Speculative Biased Decoding for Faster Re-Translation
por: Zeng, Linxiao, et al.
Publicado: (2025)
por: Zeng, Linxiao, et al.
Publicado: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
por: Xiao, Bin, et al.
Publicado: (2024)
por: Xiao, Bin, et al.
Publicado: (2024)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
por: Xiao, Bin, et al.
Publicado: (2024)
por: Xiao, Bin, et al.
Publicado: (2024)
Benchmarking the Energy Savings with Speculative Decoding Strategies
por: Dutta, Rohit, et al.
Publicado: (2026)
por: Dutta, Rohit, et al.
Publicado: (2026)
On Speculative Decoding for Multimodal Large Language Models
por: Gagrani, Mukul, et al.
Publicado: (2024)
por: Gagrani, Mukul, et al.
Publicado: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025)
por: Fu, Jiale, et al.
Publicado: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
por: Huang, Kaixuan, et al.
Publicado: (2024)
por: Huang, Kaixuan, et al.
Publicado: (2024)
Confidence-Modulated Speculative Decoding for Large Language Models
por: Sen, Jaydip, et al.
Publicado: (2025)
por: Sen, Jaydip, et al.
Publicado: (2025)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
por: Li, Ruixiao, et al.
Publicado: (2025)
por: Li, Ruixiao, et al.
Publicado: (2025)
Make Every Draft Count: Hidden State based Speculative Decoding
por: Chen, Yuetao, et al.
Publicado: (2026)
por: Chen, Yuetao, et al.
Publicado: (2026)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
por: Li, Shenggui, et al.
Publicado: (2026)
por: Li, Shenggui, et al.
Publicado: (2026)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
por: Hu, Yuezhou, et al.
Publicado: (2025)
por: Hu, Yuezhou, et al.
Publicado: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
por: Zhou, Yongchao, et al.
Publicado: (2023)
por: Zhou, Yongchao, et al.
Publicado: (2023)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
por: Huang, Langlin, et al.
Publicado: (2025)
por: Huang, Langlin, et al.
Publicado: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025)
por: Yang, Penghui, et al.
Publicado: (2025)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
por: Shoham, Ofir Ben
Publicado: (2026)
por: Shoham, Ofir Ben
Publicado: (2026)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
por: Ryu, Hyun, et al.
Publicado: (2024)
por: Ryu, Hyun, et al.
Publicado: (2024)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
por: Georganas, Evangelos, et al.
Publicado: (2025)
por: Georganas, Evangelos, et al.
Publicado: (2025)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
por: Hong, Fenglu, et al.
Publicado: (2025)
por: Hong, Fenglu, et al.
Publicado: (2025)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
por: Gautam, Aayush, et al.
Publicado: (2025)
por: Gautam, Aayush, et al.
Publicado: (2025)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
por: Goel, Raghavv, et al.
Publicado: (2024)
por: Goel, Raghavv, et al.
Publicado: (2024)
SSSD: Simply-Scalable Speculative Decoding
por: Marzollo, Michele, et al.
Publicado: (2024)
por: Marzollo, Michele, et al.
Publicado: (2024)
SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications
por: Oliaro, Gabriele, et al.
Publicado: (2024)
por: Oliaro, Gabriele, et al.
Publicado: (2024)
Confidence-aware Self-Semantic Distillation on Knowledge Graph Embedding
por: Liu, Yichen, et al.
Publicado: (2022)
por: Liu, Yichen, et al.
Publicado: (2022)
ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models
por: Ondov, Brian, et al.
Publicado: (2026)
por: Ondov, Brian, et al.
Publicado: (2026)
SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection
por: Tang, Kexian, et al.
Publicado: (2026)
por: Tang, Kexian, et al.
Publicado: (2026)
Ejemplares similares
-
REST: Retrieval-Based Speculative Decoding
por: He, Zhenyu, et al.
Publicado: (2023) -
A Theoretical Perspective for Speculative Decoding Algorithm
por: Yin, Ming, et al.
Publicado: (2024) -
Mixture of Attentions For Speculative Decoding
por: Zimmer, Matthieu, et al.
Publicado: (2024) -
Online Speculative Decoding
por: Liu, Xiaoxuan, et al.
Publicado: (2023) -
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
por: Zhang, Yudi, et al.
Publicado: (2025)