Speculative Decoding Scaling Laws (SDSL): Throughput Optimization Made Simple
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bozorgkhoo, Amirhossein, Molybog, Igor |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Block Verification Accelerates Speculative Decoding
par: Sun, Ziteng, et autres
Publié: (2024)
par: Sun, Ziteng, et autres
Publié: (2024)
SpecTr: Fast Speculative Decoding via Optimal Transport
par: Sun, Ziteng, et autres
Publié: (2023)
par: Sun, Ziteng, et autres
Publié: (2023)
SODBench: A Large Language Model Approach to Documenting Spreadsheet Operations
par: Indika, Amila, et autres
Publié: (2025)
par: Indika, Amila, et autres
Publié: (2025)
BCAmirs at SemEval-2024 Task 4: Beyond Words: A Multimodal and Multilingual Exploration of Persuasion in Memes
par: Abaskohi, Amirhossein, et autres
Publié: (2024)
par: Abaskohi, Amirhossein, et autres
Publié: (2024)
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)
par: He, Zhenyu, et autres
Publié: (2023)
Multi-Draft Speculative Sampling: Canonical Decomposition and Theoretical Limits
par: Khisti, Ashish, et autres
Publié: (2024)
par: Khisti, Ashish, et autres
Publié: (2024)
Scaling Speculative Decoding with Lookahead Reasoning
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
A Simple Model of Inference Scaling Laws
par: Levi, Noam
Publié: (2024)
par: Levi, Noam
Publié: (2024)
Speeding up Speculative Decoding via Sequential Approximate Verification
par: Zhong, Meiyu, et autres
Publié: (2025)
par: Zhong, Meiyu, et autres
Publié: (2025)
Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations
par: Halperin, Igor
Publié: (2025)
par: Halperin, Igor
Publié: (2025)
Greedy Multi-Path Block Verification for Faster Decoding in Speculative Sampling
par: Thomas, Rahul, et autres
Publié: (2026)
par: Thomas, Rahul, et autres
Publié: (2026)
SPEX: Scaling Feature Interaction Explanations for LLMs
par: Kang, Justin Singh, et autres
Publié: (2025)
par: Kang, Justin Singh, et autres
Publié: (2025)
LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
par: Samarin, Alexander, et autres
Publié: (2026)
par: Samarin, Alexander, et autres
Publié: (2026)
Accelerating Retrieval-Augmented Language Model Serving with Speculation
par: Zhang, Zhihao, et autres
Publié: (2024)
par: Zhang, Zhihao, et autres
Publié: (2024)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
L$^2$M: Mutual Information Scaling Law for Long-Context Language Modeling
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
Future Validity is the Missing Statistic: From Impossibility to $Φ$-Estimation for Grammar-Faithful Speculative Decoding
par: Nie, Wenhua, et autres
Publié: (2026)
par: Nie, Wenhua, et autres
Publié: (2026)
Proposal and study of statistical features for string similarity computation and classification
par: Rodrigues, E. O., et autres
Publié: (2026)
par: Rodrigues, E. O., et autres
Publié: (2026)
Efficient Learned Data Compression via Dual-Stream Feature Decoupling
par: Ma, Huidong, et autres
Publié: (2026)
par: Ma, Huidong, et autres
Publié: (2026)
Effective Context in Transformers: An Analysis of Fragmentation and Tokenization
par: Fesharaki, Amirmehdi Jafari, et autres
Publié: (2026)
par: Fesharaki, Amirmehdi Jafari, et autres
Publié: (2026)
RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory
par: Zuo, Fei, et autres
Publié: (2026)
par: Zuo, Fei, et autres
Publié: (2026)
Filtering Beats Fine Tuning: A Bayesian Kalman View of In Context Learning in LLMs
par: Kiruluta, Andrew
Publié: (2026)
par: Kiruluta, Andrew
Publié: (2026)
A Rate-Distortion Framework for Summarization
par: Arda, Enes, et autres
Publié: (2025)
par: Arda, Enes, et autres
Publié: (2025)
Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains
par: Makkuva, Ashok Vardhan, et autres
Publié: (2024)
par: Makkuva, Ashok Vardhan, et autres
Publié: (2024)
Theoretical guarantees on the best-of-n alignment policy
par: Beirami, Ahmad, et autres
Publié: (2024)
par: Beirami, Ahmad, et autres
Publié: (2024)
Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning
par: Liu, Qiang, et autres
Publié: (2025)
par: Liu, Qiang, et autres
Publié: (2025)
Understanding Factual Recall in Transformers via Associative Memories
par: Nichani, Eshaan, et autres
Publié: (2024)
par: Nichani, Eshaan, et autres
Publié: (2024)
An Information-theoretic Multi-task Representation Learning Framework for Natural Language Understanding
par: Hu, Dou, et autres
Publié: (2025)
par: Hu, Dou, et autres
Publié: (2025)
InfAlign: Inference-aware language model alignment
par: Balashankar, Ananth, et autres
Publié: (2024)
par: Balashankar, Ananth, et autres
Publié: (2024)
A Mathematical Theory for Learning Semantic Languages by Abstract Learners
par: Liao, Kuo-Yu, et autres
Publié: (2024)
par: Liao, Kuo-Yu, et autres
Publié: (2024)
Transformers on Markov Data: Constant Depth Suffices
par: Rajaraman, Nived, et autres
Publié: (2024)
par: Rajaraman, Nived, et autres
Publié: (2024)
What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?
par: Zhang, Yizhe, et autres
Publié: (2025)
par: Zhang, Yizhe, et autres
Publié: (2025)
An Enhanced Text Compression Approach Using Transformer-based Language Models
par: Rahman, Chowdhury Mofizur, et autres
Publié: (2024)
par: Rahman, Chowdhury Mofizur, et autres
Publié: (2024)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
par: Nagle, Alliot, et autres
Publié: (2024)
par: Nagle, Alliot, et autres
Publié: (2024)
MultiTok: Variable-Length Tokenization for Efficient LLMs Adapted from LZW Compression
par: Elias, Noel, et autres
Publié: (2024)
par: Elias, Noel, et autres
Publié: (2024)
Cost-aware LLM-based Online Dataset Annotation
par: Elumar, Eray Can, et autres
Publié: (2025)
par: Elumar, Eray Can, et autres
Publié: (2025)
Iterative Counterfactual Data Augmentation
par: Plyler, Mitchell, et autres
Publié: (2025)
par: Plyler, Mitchell, et autres
Publié: (2025)
Latent Space Alignment for Semantic Channel Equalization
par: Hüttebräucker, Tomás, et autres
Publié: (2024)
par: Hüttebräucker, Tomás, et autres
Publié: (2024)
Clinical Reading Comprehension with Encoder-Decoder Models Enhanced by Direct Preference Optimization
par: Nahian, Md Sultan Al, et autres
Publié: (2024)
par: Nahian, Md Sultan Al, et autres
Publié: (2024)
Documents similaires
-
Block Verification Accelerates Speculative Decoding
par: Sun, Ziteng, et autres
Publié: (2024) -
SpecTr: Fast Speculative Decoding via Optimal Transport
par: Sun, Ziteng, et autres
Publié: (2023) -
SODBench: A Large Language Model Approach to Documenting Spreadsheet Operations
par: Indika, Amila, et autres
Publié: (2025) -
BCAmirs at SemEval-2024 Task 4: Beyond Words: A Multimodal and Multilingual Exploration of Persuasion in Memes
par: Abaskohi, Amirhossein, et autres
Publié: (2024) -
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)