Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Gabe, Ermon, Stefano |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space
par: Guo, Gabe, et autres
Publié: (2026)
par: Guo, Gabe, et autres
Publié: (2026)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
Out-of-Vocabulary Sampling Boosts Speculative Decoding
par: Timor, Nadav, et autres
Publié: (2025)
par: Timor, Nadav, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
par: Bachmann, Gregor, et autres
Publié: (2025)
par: Bachmann, Gregor, et autres
Publié: (2025)
Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution
par: Lou, Aaron, et autres
Publié: (2023)
par: Lou, Aaron, et autres
Publié: (2023)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
par: Li, Jia-Nan, et autres
Publié: (2025)
par: Li, Jia-Nan, et autres
Publié: (2025)
AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation
par: Cheng, Dongjie, et autres
Publié: (2026)
par: Cheng, Dongjie, et autres
Publié: (2026)
Boosting Lossless Speculative Decoding via Feature Sampling and Partial Alignment Distillation
par: Gui, Lujun, et autres
Publié: (2024)
par: Gui, Lujun, et autres
Publié: (2024)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
par: Shen, Yangyi, et autres
Publié: (2026)
par: Shen, Yangyi, et autres
Publié: (2026)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
You Need Better Attention Priors
par: Litman, Elon, et autres
Publié: (2026)
par: Litman, Elon, et autres
Publié: (2026)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
par: Cheng, Yunfei, et autres
Publié: (2024)
par: Cheng, Yunfei, et autres
Publié: (2024)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
par: Chen, Tianlang, et autres
Publié: (2025)
par: Chen, Tianlang, et autres
Publié: (2025)
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models
par: Goyal, Satyam, et autres
Publié: (2026)
par: Goyal, Satyam, et autres
Publié: (2026)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding
par: Sun, Shuoyang, et autres
Publié: (2026)
par: Sun, Shuoyang, et autres
Publié: (2026)
RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
par: Hoshino, Yuichiro, et autres
Publié: (2025)
par: Hoshino, Yuichiro, et autres
Publié: (2025)
Learning Harmonized Representations for Speculative Sampling
par: Zhang, Lefan, et autres
Publié: (2024)
par: Zhang, Lefan, et autres
Publié: (2024)
Confidence-Modulated Speculative Decoding for Large Language Models
par: Sen, Jaydip, et autres
Publié: (2025)
par: Sen, Jaydip, et autres
Publié: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)
par: Hu, Yuezhou, et autres
Publié: (2025)
Why Any-Order Autoregressive Models Need Two-Stream Attention: A Structural-Semantic Tradeoff
par: Pynadath, Patrick, et autres
Publié: (2026)
par: Pynadath, Patrick, et autres
Publié: (2026)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
par: Huang, Kaixuan, et autres
Publié: (2024)
par: Huang, Kaixuan, et autres
Publié: (2024)
Disentangling Length from Quality in Direct Preference Optimization
par: Park, Ryan, et autres
Publié: (2024)
par: Park, Ryan, et autres
Publié: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
par: Ziashahabi, Amir, et autres
Publié: (2025)
par: Ziashahabi, Amir, et autres
Publié: (2025)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
par: Christopher, Jacob K, et autres
Publié: (2024)
par: Christopher, Jacob K, et autres
Publié: (2024)
LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
par: Samarin, Alexander, et autres
Publié: (2026)
par: Samarin, Alexander, et autres
Publié: (2026)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
BASS: Batched Attention-optimized Speculative Sampling
par: Qian, Haifeng, et autres
Publié: (2024)
par: Qian, Haifeng, et autres
Publié: (2024)
Optimized Speculative Sampling for GPU Hardware Accelerators
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Fast Large Language Model Collaborative Decoding via Speculation
par: Fu, Jiale, et autres
Publié: (2025)
par: Fu, Jiale, et autres
Publié: (2025)
Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation
par: Manvi, Rohin, et autres
Publié: (2024)
par: Manvi, Rohin, et autres
Publié: (2024)
TapOut: A Bandit-Based Approach to Dynamic Speculative Decoding
par: Sridhar, Aditya, et autres
Publié: (2025)
par: Sridhar, Aditya, et autres
Publié: (2025)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
par: Liu, Fangcheng, et autres
Publié: (2024)
par: Liu, Fangcheng, et autres
Publié: (2024)
Documents similaires
-
ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space
par: Guo, Gabe, et autres
Publié: (2026) -
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
par: Xiao, Zilin, et autres
Publié: (2024) -
Out-of-Vocabulary Sampling Boosts Speculative Decoding
par: Timor, Nadav, et autres
Publié: (2025) -
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024) -
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
par: Bachmann, Gregor, et autres
Publié: (2025)