See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Ji, Yicheng, Zhang, Jun, Chen, Jinpeng, Wang, Cong, Shou, Lidan, Chen, Gang, Li, Huan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025)
por: Ji, Yicheng, et al.
Publicado: (2025)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
por: Zhang, Jun, et al.
Publicado: (2023)
por: Zhang, Jun, et al.
Publicado: (2023)
Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
por: Zhang, Jun, et al.
Publicado: (2026)
por: Zhang, Jun, et al.
Publicado: (2026)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
por: Xiao, Sibo, et al.
Publicado: (2025)
por: Xiao, Sibo, et al.
Publicado: (2025)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
KcMF: A Knowledge-compliant Framework for Schema and Entity Matching with Fine-tuning-free LLMs
por: Xu, Yongqin, et al.
Publicado: (2024)
por: Xu, Yongqin, et al.
Publicado: (2024)
Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States
por: Dong, Ximing, et al.
Publicado: (2026)
por: Dong, Ximing, et al.
Publicado: (2026)
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
por: Kong, Quan, et al.
Publicado: (2026)
por: Kong, Quan, et al.
Publicado: (2026)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
por: Sun, Shengyin, et al.
Publicado: (2026)
por: Sun, Shengyin, et al.
Publicado: (2026)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
por: Goel, Raghavv, et al.
Publicado: (2025)
por: Goel, Raghavv, et al.
Publicado: (2025)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
por: Liu, Chengbo, et al.
Publicado: (2024)
por: Liu, Chengbo, et al.
Publicado: (2024)
RedParrot: Accelerating NL-to-DSL for Business Analytics via Query Semantic Caching
por: Wang, Tong, et al.
Publicado: (2026)
por: Wang, Tong, et al.
Publicado: (2026)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
por: Chen, Guanzheng, et al.
Publicado: (2025)
por: Chen, Guanzheng, et al.
Publicado: (2025)
AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
por: Lu, Kuan-Wei, et al.
Publicado: (2025)
DIESEL -- Dynamic Inference-Guidance via Evasion of Semantic Embeddings in LLMs
por: Ganon, Ben, et al.
Publicado: (2024)
por: Ganon, Ben, et al.
Publicado: (2024)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
por: Liu, Fuliang, et al.
Publicado: (2026)
por: Liu, Fuliang, et al.
Publicado: (2026)
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism
por: Yu, Yijiong, et al.
Publicado: (2026)
por: Yu, Yijiong, et al.
Publicado: (2026)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
por: Zhou, Xuwen, et al.
Publicado: (2026)
por: Zhou, Xuwen, et al.
Publicado: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
por: Brown, Oscar, et al.
Publicado: (2024)
por: Brown, Oscar, et al.
Publicado: (2024)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
por: Xiao, Bin, et al.
Publicado: (2024)
por: Xiao, Bin, et al.
Publicado: (2024)
SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
por: Svirschevski, Ruslan, et al.
Publicado: (2024)
Multi-Candidate Speculative Decoding
por: Yang, Sen, et al.
Publicado: (2024)
por: Yang, Sen, et al.
Publicado: (2024)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
por: Ryu, Hyun, et al.
Publicado: (2024)
por: Ryu, Hyun, et al.
Publicado: (2024)
SAM Decoding: Speculative Decoding via Suffix Automaton
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
Traversal Verification for Speculative Tree Decoding
por: Weng, Yepeng, et al.
Publicado: (2025)
por: Weng, Yepeng, et al.
Publicado: (2025)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
por: Li, Ruixiao, et al.
Publicado: (2025)
por: Li, Ruixiao, et al.
Publicado: (2025)
Cross-Attention Speculative Decoding
por: Zhong, Wei, et al.
Publicado: (2025)
por: Zhong, Wei, et al.
Publicado: (2025)
When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs
por: Wei, Jiankun, et al.
Publicado: (2024)
por: Wei, Jiankun, et al.
Publicado: (2024)
SPEED: Speculative Pipelined Execution for Efficient Decoding
por: Hooper, Coleman, et al.
Publicado: (2023)
por: Hooper, Coleman, et al.
Publicado: (2023)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
por: Ramakrishnan, Ramchalam Kinattinkara, et al.
Publicado: (2025)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
por: Bhendawade, Nikhil, et al.
Publicado: (2025)
por: Bhendawade, Nikhil, et al.
Publicado: (2025)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
Speculative Decoding with a Speculative Vocabulary
por: Williams, Miles, et al.
Publicado: (2026)
por: Williams, Miles, et al.
Publicado: (2026)
Scaling Laws for Speculative Decoding
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
por: Kumar, Avinash, et al.
Publicado: (2025)
por: Kumar, Avinash, et al.
Publicado: (2025)
Ejemplares similares
-
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025) -
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
por: Zhang, Jun, et al.
Publicado: (2023) -
Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
por: Zhang, Jun, et al.
Publicado: (2026) -
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
por: Xiao, Sibo, et al.
Publicado: (2025) -
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
por: Li, Jinze, et al.
Publicado: (2025)