ConFu: Contemplate the Future for Better Speculative Sampling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qin, Zongyue, Goel, Raghavv, Gagrani, Mukul, Garrepalli, Risheek, Lee, Mingu, Sun, Yizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
par: Agrawal, Sudhanshu, et autres
Publié: (2025)
par: Agrawal, Sudhanshu, et autres
Publié: (2025)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)
par: Goel, Raghavv, et autres
Publié: (2024)
A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs
par: Goel, Raghavv, et autres
Publié: (2026)
par: Goel, Raghavv, et autres
Publié: (2026)
Efficient Training-Free Multi-Token Prediction via Embedding-Space Probing
par: Goel, Raghavv, et autres
Publié: (2026)
par: Goel, Raghavv, et autres
Publié: (2026)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
par: Jeon, Wonseok, et autres
Publié: (2024)
par: Jeon, Wonseok, et autres
Publié: (2024)
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
par: Agrawal, Sudhanshu, et autres
Publié: (2024)
par: Agrawal, Sudhanshu, et autres
Publié: (2024)
Optimized Multi-Token Joint Decoding with Auxiliary Model for LLM Inference
par: Qin, Zongyue, et autres
Publié: (2024)
par: Qin, Zongyue, et autres
Publié: (2024)
HMT: Hierarchical Memory Transformer for Efficient Long Context Language Processing
par: He, Zifan, et autres
Publié: (2024)
par: He, Zifan, et autres
Publié: (2024)
Optimized Speculative Sampling for GPU Hardware Accelerators
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity
par: Gautam, Aayush, et autres
Publié: (2026)
par: Gautam, Aayush, et autres
Publié: (2026)
DDIL: Diversity Enhancing Diffusion Distillation With Imitation Learning
par: Garrepalli, Risheek, et autres
Publié: (2024)
par: Garrepalli, Risheek, et autres
Publié: (2024)
Learning Harmonized Representations for Speculative Sampling
par: Zhang, Lefan, et autres
Publié: (2024)
par: Zhang, Lefan, et autres
Publié: (2024)
BASS: Batched Attention-optimized Speculative Sampling
par: Qian, Haifeng, et autres
Publié: (2024)
par: Qian, Haifeng, et autres
Publié: (2024)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
par: Timor, Nadav, et autres
Publié: (2025)
par: Timor, Nadav, et autres
Publié: (2025)
EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty
par: Li, Yuhui, et autres
Publié: (2024)
par: Li, Yuhui, et autres
Publié: (2024)
MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing
par: Kadambi, Shreya, et autres
Publié: (2025)
par: Kadambi, Shreya, et autres
Publié: (2025)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
SoftLMs: Efficient Adaptive Low-Rank Approximation of Language Models using Soft-Thresholding Mechanism
par: Bhatnagar, Priyansh, et autres
Publié: (2024)
par: Bhatnagar, Priyansh, et autres
Publié: (2024)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
par: Gui, Lujun, et autres
Publié: (2024)
par: Gui, Lujun, et autres
Publié: (2024)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
par: Bachmann, Gregor, et autres
Publié: (2025)
par: Bachmann, Gregor, et autres
Publié: (2025)
Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding
par: Guo, Gabe, et autres
Publié: (2025)
par: Guo, Gabe, et autres
Publié: (2025)
Scaling Open-Ended Reasoning to Predict the Future
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
par: Zhao, Weilin, et autres
Publié: (2025)
par: Zhao, Weilin, et autres
Publié: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
par: Wang, Xuliang, et autres
Publié: (2026)
par: Wang, Xuliang, et autres
Publié: (2026)
Test-Time Speculation
par: Kumar, Avinash, et autres
Publié: (2026)
par: Kumar, Avinash, et autres
Publié: (2026)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
par: Chen, Ziyi, et autres
Publié: (2023)
par: Chen, Ziyi, et autres
Publié: (2023)
Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
par: Li, Xueyan, et autres
Publié: (2025)
par: Li, Xueyan, et autres
Publié: (2025)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
par: Lee, Minjae, et autres
Publié: (2026)
par: Lee, Minjae, et autres
Publié: (2026)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
Better than Random: Reliable NLG Human Evaluation with Constrained Active Sampling
par: Ruan, Jie, et autres
Publié: (2024)
par: Ruan, Jie, et autres
Publié: (2024)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
STree: Speculative Tree Decoding for Hybrid State-Space Models
par: Wu, Yangchao, et autres
Publié: (2025)
par: Wu, Yangchao, et autres
Publié: (2025)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
par: Zhang, Jinbin, et autres
Publié: (2025)
par: Zhang, Jinbin, et autres
Publié: (2025)
Relational Database Augmented Large Language Model
par: Qin, Zongyue, et autres
Publié: (2024)
par: Qin, Zongyue, et autres
Publié: (2024)
Documents similaires
-
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
par: Agrawal, Sudhanshu, et autres
Publié: (2025) -
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024) -
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024) -
A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs
par: Goel, Raghavv, et autres
Publié: (2026) -
Efficient Training-Free Multi-Token Prediction via Embedding-Space Probing
par: Goel, Raghavv, et autres
Publié: (2026)