SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
Fuente:
arXiv
Guardado en:
| Autores principales: | Ji, Yicheng, Zhang, Jun, Xia, Heming, Chen, Jinpeng, Shou, Lidan, Chen, Gang, Li, Huan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
por: Ji, Yicheng, et al.
Publicado: (2026)
por: Ji, Yicheng, et al.
Publicado: (2026)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
por: Zhang, Jun, et al.
Publicado: (2023)
por: Zhang, Jun, et al.
Publicado: (2023)
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
por: Kong, Quan, et al.
Publicado: (2026)
por: Kong, Quan, et al.
Publicado: (2026)
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2026)
por: Xia, Heming, et al.
Publicado: (2026)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
por: Xiao, Sibo, et al.
Publicado: (2025)
por: Xiao, Sibo, et al.
Publicado: (2025)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
por: Liu, Tianyu, et al.
Publicado: (2025)
por: Liu, Tianyu, et al.
Publicado: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
SpecMemo: Speculative Decoding is in Your Pocket
por: Yildirim, Selin, et al.
Publicado: (2025)
por: Yildirim, Selin, et al.
Publicado: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
por: Huang, Haoyu, et al.
Publicado: (2026)
por: Huang, Haoyu, et al.
Publicado: (2026)
Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
por: Zhang, Jun, et al.
Publicado: (2026)
por: Zhang, Jun, et al.
Publicado: (2026)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
por: Sun, Ryan, et al.
Publicado: (2024)
por: Sun, Ryan, et al.
Publicado: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies
por: Chen, Zhiyang, et al.
Publicado: (2026)
por: Chen, Zhiyang, et al.
Publicado: (2026)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025)
por: Li, Guanghao, et al.
Publicado: (2025)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
por: Goel, Raghavv, et al.
Publicado: (2025)
por: Goel, Raghavv, et al.
Publicado: (2025)
KcMF: A Knowledge-compliant Framework for Schema and Entity Matching with Fine-tuning-free LLMs
por: Xu, Yongqin, et al.
Publicado: (2024)
por: Xu, Yongqin, et al.
Publicado: (2024)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
por: Zhou, Yongchao, et al.
Publicado: (2023)
por: Zhou, Yongchao, et al.
Publicado: (2023)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
por: Shi, Weijie, et al.
Publicado: (2026)
por: Shi, Weijie, et al.
Publicado: (2026)
EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation
por: Zhang, Shuyu, et al.
Publicado: (2026)
por: Zhang, Shuyu, et al.
Publicado: (2026)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
HeteroSpec: Leveraging Contextual Heterogeneity for Efficient Speculative Decoding
por: Liu, Siran, et al.
Publicado: (2025)
por: Liu, Siran, et al.
Publicado: (2025)
KNN-SSD: Enabling Dynamic Self-Speculative Decoding via Nearest Neighbor Layer Set Optimization
por: Song, Mingbo, et al.
Publicado: (2025)
por: Song, Mingbo, et al.
Publicado: (2025)
SpecTr: Fast Speculative Decoding via Optimal Transport
por: Sun, Ziteng, et al.
Publicado: (2023)
por: Sun, Ziteng, et al.
Publicado: (2023)
Spec-LLaVA: Accelerating Vision-Language Models with Dynamic Tree-Based Speculative Decoding
por: Huo, Mingxiao, et al.
Publicado: (2025)
por: Huo, Mingxiao, et al.
Publicado: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
por: Huang, Kaixuan, et al.
Publicado: (2024)
por: Huang, Kaixuan, et al.
Publicado: (2024)
Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
por: Pan, Lehan, et al.
Publicado: (2026)
por: Pan, Lehan, et al.
Publicado: (2026)
ReSpec: Towards Optimizing Speculative Decoding in Reinforcement Learning Systems
por: Chen, Qiaoling, et al.
Publicado: (2025)
por: Chen, Qiaoling, et al.
Publicado: (2025)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
por: Liu, Xing, et al.
Publicado: (2025)
por: Liu, Xing, et al.
Publicado: (2025)
SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding
por: Li, Shenggui, et al.
Publicado: (2026)
por: Li, Shenggui, et al.
Publicado: (2026)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
por: Wang, Hanzhen, et al.
Publicado: (2025)
por: Wang, Hanzhen, et al.
Publicado: (2025)
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
por: Shukla, Shikhar
Publicado: (2026)
por: Shukla, Shikhar
Publicado: (2026)
SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding
por: Sandler, Jameson, et al.
Publicado: (2025)
por: Sandler, Jameson, et al.
Publicado: (2025)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
por: Lin, Yijun, et al.
Publicado: (2026)
por: Lin, Yijun, et al.
Publicado: (2026)
SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation
por: Wang, Zihua, et al.
Publicado: (2025)
por: Wang, Zihua, et al.
Publicado: (2025)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
por: Bagrov, Natan, et al.
Publicado: (2025)
por: Bagrov, Natan, et al.
Publicado: (2025)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
por: Sun, Shengyin, et al.
Publicado: (2026)
por: Sun, Shengyin, et al.
Publicado: (2026)
Ejemplares similares
-
See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
por: Ji, Yicheng, et al.
Publicado: (2026) -
SpecVLM: Fast Speculative Decoding in Vision-Language Models
por: Huang, Haiduo, et al.
Publicado: (2025) -
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
por: Zhang, Jun, et al.
Publicado: (2023) -
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
por: Kong, Quan, et al.
Publicado: (2026) -
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2026)