Mixture of Attentions For Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zimmer, Matthieu, Gritta, Milan, Lampouras, Gerasimos, Ammar, Haitham Bou, Wang, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
par: Christopoulou, Fenia, et autres
Publié: (2024)
par: Christopoulou, Fenia, et autres
Publié: (2024)
DReSD: Dense Retrieval for Speculative Decoding
par: Gritta, Milan, et autres
Publié: (2025)
par: Gritta, Milan, et autres
Publié: (2025)
Human-inspired Episodic Memory for Infinite Context LLMs
par: Fountas, Zafeirios, et autres
Publié: (2024)
par: Fountas, Zafeirios, et autres
Publié: (2024)
DRIFT: Decompose, Retrieve, Illustrate, then Formalize Theorems
par: Zhang, Meiru, et autres
Publié: (2025)
par: Zhang, Meiru, et autres
Publié: (2025)
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers
par: Ji, Xiaotong, et autres
Publié: (2026)
par: Ji, Xiaotong, et autres
Publié: (2026)
Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods
par: Benfeghoul, Martin, et autres
Publié: (2025)
par: Benfeghoul, Martin, et autres
Publié: (2025)
The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling
par: Nguyen, Tu, et autres
Publié: (2026)
par: Nguyen, Tu, et autres
Publié: (2026)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening
par: Ji, Xiaotong, et autres
Publié: (2026)
par: Ji, Xiaotong, et autres
Publié: (2026)
Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
par: Zimmer, Matthieu, et autres
Publié: (2025)
par: Zimmer, Matthieu, et autres
Publié: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
par: Wieser, Frederico, et autres
Publié: (2025)
par: Wieser, Frederico, et autres
Publié: (2025)
HumanRankEval: Automatic Evaluation of LMs as Conversational Assistants
par: Gritta, Milan, et autres
Publié: (2024)
par: Gritta, Milan, et autres
Publié: (2024)
SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
par: Hazard, Hugo, et autres
Publié: (2025)
par: Hazard, Hugo, et autres
Publié: (2025)
Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving
par: Zimmer, Matthieu, et autres
Publié: (2025)
par: Zimmer, Matthieu, et autres
Publié: (2025)
The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus
par: Roy, Amartya, et autres
Publié: (2026)
par: Roy, Amartya, et autres
Publié: (2026)
Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
par: Bourigault, Pauline, et autres
Publié: (2026)
par: Bourigault, Pauline, et autres
Publié: (2026)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
par: Ji, Xiaotong, et autres
Publié: (2025)
par: Ji, Xiaotong, et autres
Publié: (2025)
Online Speculative Decoding
par: Liu, Xiaoxuan, et autres
Publié: (2023)
par: Liu, Xiaoxuan, et autres
Publié: (2023)
Code-Optimise: Self-Generated Preference Data for Correctness and Efficiency
par: Gee, Leonidas, et autres
Publié: (2024)
par: Gee, Leonidas, et autres
Publié: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
par: Yin, Ming, et autres
Publié: (2024)
par: Yin, Ming, et autres
Publié: (2024)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025)
par: Zeng, Linxiao, et autres
Publié: (2025)
TopoAlign: A Framework for Aligning Code to Math via Topological Decomposition
par: Li, Yupei, et autres
Publié: (2025)
par: Li, Yupei, et autres
Publié: (2025)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
Benchmarking the Energy Savings with Speculative Decoding Strategies
par: Dutta, Rohit, et autres
Publié: (2026)
par: Dutta, Rohit, et autres
Publié: (2026)
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025)
par: Kumar, Avinash, et autres
Publié: (2025)
A Benchmark for Deep Information Synthesis
par: Paul, Debjit, et autres
Publié: (2026)
par: Paul, Debjit, et autres
Publié: (2026)
Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning
par: Huang, Bingning, et autres
Publié: (2025)
par: Huang, Bingning, et autres
Publié: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
par: Huang, Kaixuan, et autres
Publié: (2024)
par: Huang, Kaixuan, et autres
Publié: (2024)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
Confidence-Modulated Speculative Decoding for Large Language Models
par: Sen, Jaydip, et autres
Publié: (2025)
par: Sen, Jaydip, et autres
Publié: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
par: Zhang, Yudi, et autres
Publié: (2025)
par: Zhang, Yudi, et autres
Publié: (2025)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
par: Xiao, Bin, et autres
Publié: (2024)
par: Xiao, Bin, et autres
Publié: (2024)
Fast Large Language Model Collaborative Decoding via Speculation
par: Fu, Jiale, et autres
Publié: (2025)
par: Fu, Jiale, et autres
Publié: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)
par: Hu, Yuezhou, et autres
Publié: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
par: Zhou, Yongchao, et autres
Publié: (2023)
par: Zhou, Yongchao, et autres
Publié: (2023)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
SENSE: Semantic Embedding Navigation with Soft-gated Evaluation for Retrieval-based Speculative Decoding
par: Chen, Shaowen, et autres
Publié: (2026)
par: Chen, Shaowen, et autres
Publié: (2026)
Documents similaires
-
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
par: Christopoulou, Fenia, et autres
Publié: (2024) -
DReSD: Dense Retrieval for Speculative Decoding
par: Gritta, Milan, et autres
Publié: (2025) -
Human-inspired Episodic Memory for Infinite Context LLMs
par: Fountas, Zafeirios, et autres
Publié: (2024) -
DRIFT: Decompose, Retrieve, Illustrate, then Formalize Theorems
par: Zhang, Meiru, et autres
Publié: (2025) -
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers
par: Ji, Xiaotong, et autres
Publié: (2026)