Fast Inference via Hierarchical Speculative Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Mohri, Clara, Kaplan, Haim, Schuster, Tal, Mansour, Yishay, Globerson, Amir |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cost-Aware Learning
di: Mohri, Clara, et al.
Pubblicazione: (2026)
di: Mohri, Clara, et al.
Pubblicazione: (2026)
Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning
di: Dann, Christoph, et al.
Pubblicazione: (2026)
di: Dann, Christoph, et al.
Pubblicazione: (2026)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
Bayesian Perspective on Memorization and Reconstruction
di: Kaplan, Haim, et al.
Pubblicazione: (2025)
di: Kaplan, Haim, et al.
Pubblicazione: (2025)
Learning-Augmented Algorithms with Explicit Predictors
di: Elias, Marek, et al.
Pubblicazione: (2024)
di: Elias, Marek, et al.
Pubblicazione: (2024)
Individual Regret in Cooperative Stochastic Multi-Armed Bandits
di: Barnea, Idan, et al.
Pubblicazione: (2024)
di: Barnea, Idan, et al.
Pubblicazione: (2024)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
Rate-Preserving Reductions for Blackwell Approachability
di: Dann, Christoph, et al.
Pubblicazione: (2024)
di: Dann, Christoph, et al.
Pubblicazione: (2024)
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Delay as Payoff in MAB
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2024)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2024)
Rising Rested MAB with Linear Drift
di: Amichay, Omer, et al.
Pubblicazione: (2025)
di: Amichay, Omer, et al.
Pubblicazione: (2025)
Optimal Regret for Policy Optimization in Contextual Bandits
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
Non-stochastic Bandits With Evolving Observations
di: Bar-On, Yogev, et al.
Pubblicazione: (2024)
di: Bar-On, Yogev, et al.
Pubblicazione: (2024)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
How to Boost Any Loss Function
di: Nock, Richard, et al.
Pubblicazione: (2024)
di: Nock, Richard, et al.
Pubblicazione: (2024)
When Can Transformers Count to n?
di: Yehudai, Gilad, et al.
Pubblicazione: (2024)
di: Yehudai, Gilad, et al.
Pubblicazione: (2024)
Swap Regret and Correlated Equilibria Beyond Normal-Form Games
di: Arunachaleswaran, Eshwar Ram, et al.
Pubblicazione: (2025)
di: Arunachaleswaran, Eshwar Ram, et al.
Pubblicazione: (2025)
Fast Rates for Bandit PAC Multiclass Classification
di: Erez, Liad, et al.
Pubblicazione: (2024)
di: Erez, Liad, et al.
Pubblicazione: (2024)
The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration
di: Barnea, Idan, et al.
Pubblicazione: (2026)
di: Barnea, Idan, et al.
Pubblicazione: (2026)
Collaborating in Multi-Armed Bandits with Strategic Agents
di: Barnea, Idan, et al.
Pubblicazione: (2026)
di: Barnea, Idan, et al.
Pubblicazione: (2026)
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
A Characterization of Semi-Supervised Adversarially-Robust PAC Learnability
di: Attias, Idan, et al.
Pubblicazione: (2022)
di: Attias, Idan, et al.
Pubblicazione: (2022)
Regret Minimization and Convergence to Equilibria in General-sum Markov Games
di: Erez, Liad, et al.
Pubblicazione: (2022)
di: Erez, Liad, et al.
Pubblicazione: (2022)
Speculative Speculative Decoding
di: Kumar, Tanishq, et al.
Pubblicazione: (2026)
di: Kumar, Tanishq, et al.
Pubblicazione: (2026)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2025)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
di: Bang, Jehyeon, et al.
Pubblicazione: (2026)
di: Bang, Jehyeon, et al.
Pubblicazione: (2026)
SPIRe: Boosting LLM Inference Throughput with Speculative Decoding
di: Neelam, Sanjit, et al.
Pubblicazione: (2025)
di: Neelam, Sanjit, et al.
Pubblicazione: (2025)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
di: Sherman, Uri, et al.
Pubblicazione: (2025)
di: Sherman, Uri, et al.
Pubblicazione: (2025)
Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning
di: Sherman, Uri, et al.
Pubblicazione: (2025)
di: Sherman, Uri, et al.
Pubblicazione: (2025)
Budgeted Multiple-Expert Deferral
di: DeSalvo, Giulia, et al.
Pubblicazione: (2025)
di: DeSalvo, Giulia, et al.
Pubblicazione: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
On the Optimization Landscape of Maximum Mean Discrepancy
di: Alon, Itai, et al.
Pubblicazione: (2021)
di: Alon, Itai, et al.
Pubblicazione: (2021)
HiSpec: Hierarchical Speculative Decoding for LLMs
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
di: Levy, Orin, et al.
Pubblicazione: (2025)
di: Levy, Orin, et al.
Pubblicazione: (2025)
The Hidden Cost of Approximation in Online Mirror Descent
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2025)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
Eluder-based Regret for Stochastic Contextual MDPs
di: Levy, Orin, et al.
Pubblicazione: (2022)
di: Levy, Orin, et al.
Pubblicazione: (2022)
Probably Approximately Precision and Recall Learning
di: Cohen, Lee, et al.
Pubblicazione: (2024)
di: Cohen, Lee, et al.
Pubblicazione: (2024)
Online Set Learning from Precision and Recall Feedback
di: Cohen, Lee, et al.
Pubblicazione: (2026)
di: Cohen, Lee, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Cost-Aware Learning
di: Mohri, Clara, et al.
Pubblicazione: (2026) -
Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning
di: Dann, Christoph, et al.
Pubblicazione: (2026) -
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
di: Lancewicki, Tal, et al.
Pubblicazione: (2025) -
Bayesian Perspective on Memorization and Reconstruction
di: Kaplan, Haim, et al.
Pubblicazione: (2025) -
Learning-Augmented Algorithms with Explicit Predictors
di: Elias, Marek, et al.
Pubblicazione: (2024)