Guardado en:
| Autores principales: | Ning, Zhiyuan, Shao, Jiawei, Xu, Ruge, Guo, Xinfei, Zhang, Jun, Zhang, Chi, Li, Xuelong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.26843 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
por: Li, Ruanjun, et al.
Publicado: (2025)
por: Li, Ruanjun, et al.
Publicado: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025)
por: Yang, Penghui, et al.
Publicado: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
por: Hou, Yunlong, et al.
Publicado: (2025)
por: Hou, Yunlong, et al.
Publicado: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
por: Huang, Kaixuan, et al.
Publicado: (2024)
por: Huang, Kaixuan, et al.
Publicado: (2024)
SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
por: Zhong, Linfeng, et al.
Publicado: (2025)
por: Zhong, Linfeng, et al.
Publicado: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)
por: Sun, Ryan, et al.
Publicado: (2024)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
SpecFed: Accelerating Federated LLM Inference with Speculative Decoding and Compressed Transmission
por: Zheng, Ce, et al.
Publicado: (2026)
por: Zheng, Ce, et al.
Publicado: (2026)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
por: Liu, Xing, et al.
Publicado: (2025)
por: Liu, Xing, et al.
Publicado: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025)
por: Ji, Yicheng, et al.
Publicado: (2025)
Overcoming Joint Intractability with Lossless Hierarchical Speculative Decoding
por: Zhou, Yuxuan, et al.
Publicado: (2026)
por: Zhou, Yuxuan, et al.
Publicado: (2026)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
por: Agrawal, Sudhanshu, et al.
Publicado: (2025)
KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem
por: Cha, Seongjin, et al.
Publicado: (2026)
por: Cha, Seongjin, et al.
Publicado: (2026)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
por: Xu, Jiaming, et al.
Publicado: (2025)
por: Xu, Jiaming, et al.
Publicado: (2025)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
por: Zhao, Yilong, et al.
Publicado: (2025)
por: Zhao, Yilong, et al.
Publicado: (2025)
QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache
por: Tiwari, Rishabh, et al.
Publicado: (2025)
por: Tiwari, Rishabh, et al.
Publicado: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025)
por: Li, Guanghao, et al.
Publicado: (2025)
SpecPipe: Accelerating Pipeline Parallelism-based LLM Inference with Speculative Decoding
por: Yin, Haofei, et al.
Publicado: (2025)
por: Yin, Haofei, et al.
Publicado: (2025)
CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration
por: Han, Yuning, et al.
Publicado: (2026)
por: Han, Yuning, et al.
Publicado: (2026)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
por: Zhao, Weilin, et al.
Publicado: (2025)
por: Zhao, Weilin, et al.
Publicado: (2025)
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
por: Bang, Jehyeon, et al.
Publicado: (2026)
por: Bang, Jehyeon, et al.
Publicado: (2026)
SpecMemo: Speculative Decoding is in Your Pocket
por: Yildirim, Selin, et al.
Publicado: (2025)
por: Yildirim, Selin, et al.
Publicado: (2025)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
por: Shukla, Shikhar
Publicado: (2026)
por: Shukla, Shikhar
Publicado: (2026)
SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation
por: Pan, Jiayi, et al.
Publicado: (2025)
por: Pan, Jiayi, et al.
Publicado: (2025)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
por: Zhang, Jun, et al.
Publicado: (2023)
por: Zhang, Jun, et al.
Publicado: (2023)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies
por: Chen, Zhiyang, et al.
Publicado: (2026)
por: Chen, Zhiyang, et al.
Publicado: (2026)
Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity
por: An, Hongjun, et al.
Publicado: (2026)
por: An, Hongjun, et al.
Publicado: (2026)
CopySpec: Accelerating LLMs with Speculative Copy-and-Paste Without Compromising Quality
por: Dumitru, Razvan-Gabriel, et al.
Publicado: (2025)
por: Dumitru, Razvan-Gabriel, et al.
Publicado: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
por: Zhou, Yongchao, et al.
Publicado: (2023)
por: Zhou, Yongchao, et al.
Publicado: (2023)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
por: Zeng, Ziqian, et al.
Publicado: (2024)
por: Zeng, Ziqian, et al.
Publicado: (2024)
FAMES: Fast Approximate Multiplier Substitution for Mixed-Precision Quantized DNNs--Down to 2 Bits!
por: Ren, Yi, et al.
Publicado: (2024)
por: Ren, Yi, et al.
Publicado: (2024)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
por: Wen, Zhuofan, et al.
Publicado: (2026)
por: Wen, Zhuofan, et al.
Publicado: (2026)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
por: Yang, Rubing, et al.
Publicado: (2025)
por: Yang, Rubing, et al.
Publicado: (2025)
Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
por: Wu, Shutong, et al.
Publicado: (2025)
por: Wu, Shutong, et al.
Publicado: (2025)
SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
Ejemplares similares
-
Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
por: Li, Ruanjun, et al.
Publicado: (2025) -
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
por: Yang, Penghui, et al.
Publicado: (2025) -
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024) -
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025) -
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)