Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Bin, Shi, Chunan, Nie, Xiaonan, Yang, Fan, Deng, Xiangwei, Su, Lei, Chen, Weipeng, Cui, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
di: Xiao, Bin, et al.
Pubblicazione: (2024)
di: Xiao, Bin, et al.
Pubblicazione: (2024)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024)
di: Gui, Lujun, et al.
Pubblicazione: (2024)
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
di: Zhang, Hailin, et al.
Pubblicazione: (2024)
di: Zhang, Hailin, et al.
Pubblicazione: (2024)
Scaling Laws for Speculative Decoding
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
di: Yan, Siyuan, et al.
Pubblicazione: (2025)
Cerberus: Efficient Inference with Adaptive Parallel Decoding and Sequential Knowledge Enhancement
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
Online Speculative Decoding
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2023)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
di: Wang, Ziyao, et al.
Pubblicazione: (2025)
di: Wang, Ziyao, et al.
Pubblicazione: (2025)
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
di: Su, Xin, et al.
Pubblicazione: (2026)
di: Su, Xin, et al.
Pubblicazione: (2026)
The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models
di: Wang, Zheng, et al.
Pubblicazione: (2026)
di: Wang, Zheng, et al.
Pubblicazione: (2026)
Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning
di: Su, Tiancheng, et al.
Pubblicazione: (2025)
di: Su, Tiancheng, et al.
Pubblicazione: (2025)
Speculative Decoding for Multi-Sample Inference
di: Li, Yiwei, et al.
Pubblicazione: (2025)
di: Li, Yiwei, et al.
Pubblicazione: (2025)
Traversal Verification for Speculative Tree Decoding
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
di: Li, Youquan, et al.
Pubblicazione: (2024)
di: Li, Youquan, et al.
Pubblicazione: (2024)
The Disparate Impacts of Speculative Decoding
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
di: Sandler, Jameson, et al.
Pubblicazione: (2025)
Constrained Decoding with Speculative Lookaheads
di: Nakshatri, Nishanth, et al.
Pubblicazione: (2024)
di: Nakshatri, Nishanth, et al.
Pubblicazione: (2024)
Cross-Attention Speculative Decoding
di: Zhong, Wei, et al.
Pubblicazione: (2025)
di: Zhong, Wei, et al.
Pubblicazione: (2025)
Speculative Decoding: Performance or Illusion?
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxuan, et al.
Pubblicazione: (2025)
Mamba Drafters for Speculative Decoding
di: Choi, Daewon, et al.
Pubblicazione: (2025)
di: Choi, Daewon, et al.
Pubblicazione: (2025)
Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding
di: Jin, Tao, et al.
Pubblicazione: (2026)
di: Jin, Tao, et al.
Pubblicazione: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
di: Brown, Oscar, et al.
Pubblicazione: (2024)
di: Brown, Oscar, et al.
Pubblicazione: (2024)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
di: Hu, Yuezhou, et al.
Pubblicazione: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
Self-Speculative Biased Decoding for Faster Re-Translation
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
di: Zeng, Linxiao, et al.
Pubblicazione: (2025)
Batch Speculative Decoding Done Right
di: Zhang, Ranran Haoran, et al.
Pubblicazione: (2025)
di: Zhang, Ranran Haoran, et al.
Pubblicazione: (2025)
RASD: Retrieval-Augmented Speculative Decoding
di: Quan, Guofeng, et al.
Pubblicazione: (2025)
di: Quan, Guofeng, et al.
Pubblicazione: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
di: Ma, Zhiyao, et al.
Pubblicazione: (2025)
di: Ma, Zhiyao, et al.
Pubblicazione: (2025)
Small but Mighty: Enhancing Time Series Forecasting with Lightweight LLMs
di: Fan, Haoran, et al.
Pubblicazione: (2025)
di: Fan, Haoran, et al.
Pubblicazione: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
di: Sun, Ryan, et al.
Pubblicazione: (2024)
di: Sun, Ryan, et al.
Pubblicazione: (2024)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
di: Li, Shenggui, et al.
Pubblicazione: (2026)
di: Li, Shenggui, et al.
Pubblicazione: (2026)
EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation
di: Zhang, Shuyu, et al.
Pubblicazione: (2026)
di: Zhang, Shuyu, et al.
Pubblicazione: (2026)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
di: Xiao, Sibo, et al.
Pubblicazione: (2025)
di: Xiao, Sibo, et al.
Pubblicazione: (2025)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
di: Zhang, Situo, et al.
Pubblicazione: (2026)
di: Zhang, Situo, et al.
Pubblicazione: (2026)
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
SAM Decoding: Speculative Decoding via Suffix Automaton
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling
di: Xu, Wenda, et al.
Pubblicazione: (2024)
di: Xu, Wenda, et al.
Pubblicazione: (2024)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding
di: Zhang, Zihong, et al.
Pubblicazione: (2026)
di: Zhang, Zihong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
di: Xiao, Bin, et al.
Pubblicazione: (2024) -
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
di: Gui, Lujun, et al.
Pubblicazione: (2024) -
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
di: Zhang, Hailin, et al.
Pubblicazione: (2024) -
Scaling Laws for Speculative Decoding
di: Yan, Siyuan, et al.
Pubblicazione: (2025) -
Cerberus: Efficient Inference with Adaptive Parallel Decoding and Sequential Knowledge Enhancement
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)