Enregistré dans:
| Auteurs principaux: | Hoang, Duc, Jaiswal, Ajay, Samragh, Mohammad, Cho, Minsik |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.03921 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models
par: Kim, Han-Byul, et autres
Publié: (2025)
par: Kim, Han-Byul, et autres
Publié: (2025)
TIDE: Every Layer Knows the Token Beneath the Context
par: Jaiswal, Ajay, et autres
Publié: (2026)
par: Jaiswal, Ajay, et autres
Publié: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
par: Zibakhsh, Soheil, et autres
Publié: (2025)
par: Zibakhsh, Soheil, et autres
Publié: (2025)
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why
par: Armandpour, Mohammadreza, et autres
Publié: (2026)
par: Armandpour, Mohammadreza, et autres
Publié: (2026)
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
par: Hannah, Lauren. A, et autres
Publié: (2025)
par: Hannah, Lauren. A, et autres
Publié: (2025)
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
par: Bang, Jehyeon, et autres
Publié: (2026)
par: Bang, Jehyeon, et autres
Publié: (2026)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
par: Samragh, Mohammad, et autres
Publié: (2024)
par: Samragh, Mohammad, et autres
Publié: (2024)
Finding Fantastic Experts in MoEs: A Unified Study for Expert Dropping Strategies and Observations
par: Jaiswal, Ajay, et autres
Publié: (2025)
par: Jaiswal, Ajay, et autres
Publié: (2025)
SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long Sequences
par: Cha, Jungyoub, et autres
Publié: (2025)
par: Cha, Jungyoub, et autres
Publié: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025)
par: Kumar, Avinash, et autres
Publié: (2025)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
par: Hou, Yunlong, et autres
Publié: (2025)
par: Hou, Yunlong, et autres
Publié: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
par: Tiwari, Rishabh, et autres
Publié: (2025)
par: Tiwari, Rishabh, et autres
Publié: (2025)
MemoryLLM: Plug-n-Play Interpretable Feed-Forward Memory for Transformers
par: Jaiswal, Ajay, et autres
Publié: (2026)
par: Jaiswal, Ajay, et autres
Publié: (2026)
SpecMemo: Speculative Decoding is in Your Pocket
par: Yildirim, Selin, et autres
Publié: (2025)
par: Yildirim, Selin, et autres
Publié: (2025)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
par: Wang, Songsheng, et autres
Publié: (2025)
par: Wang, Songsheng, et autres
Publié: (2025)
SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning
par: Pan, Rui, et autres
Publié: (2025)
par: Pan, Rui, et autres
Publié: (2025)
Speculating Experts Accelerates Inference for Mixture-of-Experts
par: Madan, Vivan, et autres
Publié: (2026)
par: Madan, Vivan, et autres
Publié: (2026)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
par: Zhou, Yongchao, et autres
Publié: (2023)
par: Zhou, Yongchao, et autres
Publié: (2023)
Towards Low-bit Communication for Tensor Parallel LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
par: Georganas, Evangelos, et autres
Publié: (2025)
par: Georganas, Evangelos, et autres
Publié: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
par: Yang, Rubing, et autres
Publié: (2025)
par: Yang, Rubing, et autres
Publié: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
par: Huang, Kaixuan, et autres
Publié: (2024)
par: Huang, Kaixuan, et autres
Publié: (2024)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
par: Xu, Yuhang, et autres
Publié: (2026)
par: Xu, Yuhang, et autres
Publié: (2026)
KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem
par: Cha, Seongjin, et autres
Publié: (2026)
par: Cha, Seongjin, et autres
Publié: (2026)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
par: Ning, Zhiyuan, et autres
Publié: (2025)
par: Ning, Zhiyuan, et autres
Publié: (2025)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
par: Li, Shenggui, et autres
Publié: (2026)
par: Li, Shenggui, et autres
Publié: (2026)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
par: Wen, Zhuofan, et autres
Publié: (2026)
par: Wen, Zhuofan, et autres
Publié: (2026)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
par: Fu, Qichen, et autres
Publié: (2024)
par: Fu, Qichen, et autres
Publié: (2024)
Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context
par: Alizadeh, Keivan, et autres
Publié: (2026)
par: Alizadeh, Keivan, et autres
Publié: (2026)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
par: Zhang, Jinbin, et autres
Publié: (2025)
par: Zhang, Jinbin, et autres
Publié: (2025)
Do Compressed LLMs Forget Knowledge? An Experimental Study with Practical Implications
par: Hoang, Duc N. M, et autres
Publié: (2023)
par: Hoang, Duc N. M, et autres
Publié: (2023)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
par: Zhao, Weilin, et autres
Publié: (2025)
par: Zhao, Weilin, et autres
Publié: (2025)
Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity
par: Joudaki, Amir, et autres
Publié: (2025)
par: Joudaki, Amir, et autres
Publié: (2025)
Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs
par: Yin, Lu, et autres
Publié: (2023)
par: Yin, Lu, et autres
Publié: (2023)
LLaGA: Large Language and Graph Assistant
par: Chen, Runjin, et autres
Publié: (2024)
par: Chen, Runjin, et autres
Publié: (2024)
Your LLM Knows the Future: Uncovering Its Multi-Token Prediction Potential
par: Samragh, Mohammad, et autres
Publié: (2025)
par: Samragh, Mohammad, et autres
Publié: (2025)
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
par: Dong, Yanhao, et autres
Publié: (2025)
par: Dong, Yanhao, et autres
Publié: (2025)
Explainable AI in Time-Sensitive Scenarios: Prefetched Offline Explanation Model
par: Russo, Fabio Michele, et autres
Publié: (2025)
par: Russo, Fabio Michele, et autres
Publié: (2025)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
par: Shukla, Shikhar
Publié: (2026)
par: Shukla, Shikhar
Publié: (2026)
Documents similaires
-
SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models
par: Kim, Han-Byul, et autres
Publié: (2025) -
TIDE: Every Layer Knows the Token Beneath the Context
par: Jaiswal, Ajay, et autres
Publié: (2026) -
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
par: Zibakhsh, Soheil, et autres
Publié: (2025) -
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why
par: Armandpour, Mohammadreza, et autres
Publié: (2026) -
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
par: Hannah, Lauren. A, et autres
Publié: (2025)