CoVSpec: Efficient Device-Edge Co-Inference for Vision-Language Models via Speculative Decoding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jia, Yuanyuan, Tang, Shunpu, Yang, Qianqian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FeDeRA:Efficient Fine-tuning of Language Models in Federated Learning Leveraging Weight Decomposition
von: Yan, Yuxuan, et al.
Veröffentlicht: (2024)
von: Yan, Yuxuan, et al.
Veröffentlicht: (2024)
GCoDE: Efficient Device-Edge Co-Inference for GNNs via Architecture-Mapping Co-Search
von: Zhou, Ao, et al.
Veröffentlicht: (2025)
von: Zhou, Ao, et al.
Veröffentlicht: (2025)
WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference
von: Liu, Zixuan, et al.
Veröffentlicht: (2026)
von: Liu, Zixuan, et al.
Veröffentlicht: (2026)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
von: Bajpai, Divya Jyoti, et al.
Veröffentlicht: (2025)
von: Bajpai, Divya Jyoti, et al.
Veröffentlicht: (2025)
Dynamic-Width Speculative Beam Decoding for Efficient LLM Inference
von: Qin, Zongyue, et al.
Veröffentlicht: (2024)
von: Qin, Zongyue, et al.
Veröffentlicht: (2024)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
von: Huang, Haiduo, et al.
Veröffentlicht: (2025)
von: Huang, Haiduo, et al.
Veröffentlicht: (2025)
Graph Neural Networks Automated Design and Deployment on Device-Edge Co-Inference Systems
von: Zhou, Ao, et al.
Veröffentlicht: (2024)
von: Zhou, Ao, et al.
Veröffentlicht: (2024)
FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
von: Liu, Xing, et al.
Veröffentlicht: (2025)
von: Liu, Xing, et al.
Veröffentlicht: (2025)
Conformal Sparsification for Bandwidth-Efficient Edge-Cloud Speculative Decoding
von: Bhattacharjee, Payel, et al.
Veröffentlicht: (2025)
von: Bhattacharjee, Payel, et al.
Veröffentlicht: (2025)
Energy-Efficient Wireless LLM Inference via Uncertainty and Importance-Aware Speculative Decoding
von: Park, Jihoon, et al.
Veröffentlicht: (2025)
von: Park, Jihoon, et al.
Veröffentlicht: (2025)
HADES: Hardware Accelerated Decoding for Efficient Speculation in Large Language Models
von: Yang, Ze, et al.
Veröffentlicht: (2024)
von: Yang, Ze, et al.
Veröffentlicht: (2024)
Speculative Decoding for Multi-Sample Inference
von: Li, Yiwei, et al.
Veröffentlicht: (2025)
von: Li, Yiwei, et al.
Veröffentlicht: (2025)
Efficient Partitioning Vision Transformer on Edge Devices for Distributed Inference
von: Liu, Xiang, et al.
Veröffentlicht: (2024)
von: Liu, Xiang, et al.
Veröffentlicht: (2024)
Fast Large Language Model Collaborative Decoding via Speculation
von: Fu, Jiale, et al.
Veröffentlicht: (2025)
von: Fu, Jiale, et al.
Veröffentlicht: (2025)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
von: Wang, Songsheng, et al.
Veröffentlicht: (2025)
von: Wang, Songsheng, et al.
Veröffentlicht: (2025)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
von: Li, Guanghao, et al.
Veröffentlicht: (2025)
von: Li, Guanghao, et al.
Veröffentlicht: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
von: Wen, Zhuofan, et al.
Veröffentlicht: (2024)
von: Wen, Zhuofan, et al.
Veröffentlicht: (2024)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
von: Zhao, Yilong, et al.
Veröffentlicht: (2025)
von: Zhao, Yilong, et al.
Veröffentlicht: (2025)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding
von: Ryu, Hyun, et al.
Veröffentlicht: (2024)
von: Ryu, Hyun, et al.
Veröffentlicht: (2024)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
von: Jeon, Wonseok, et al.
Veröffentlicht: (2024)
von: Jeon, Wonseok, et al.
Veröffentlicht: (2024)
SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding
von: Bang, Jehyeon, et al.
Veröffentlicht: (2026)
von: Bang, Jehyeon, et al.
Veröffentlicht: (2026)
HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models
von: Xie, Zhinan, et al.
Veröffentlicht: (2025)
von: Xie, Zhinan, et al.
Veröffentlicht: (2025)
On Speculative Decoding for Multimodal Large Language Models
von: Gagrani, Mukul, et al.
Veröffentlicht: (2024)
von: Gagrani, Mukul, et al.
Veröffentlicht: (2024)
S$^4$C: Speculative Sampling with Syntactic and Semantic Coherence for Efficient Inference of Large Language Models
von: He, Tao, et al.
Veröffentlicht: (2025)
von: He, Tao, et al.
Veröffentlicht: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
von: Lin, Zijian, et al.
Veröffentlicht: (2025)
von: Lin, Zijian, et al.
Veröffentlicht: (2025)
Efficient Long CoT Reasoning in Small Language Models
von: Wang, Zhaoyang, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoyang, et al.
Veröffentlicht: (2025)
Speculate, then Collaborate: Fusing Knowledge of Language Models during Decoding
von: Wang, Ziyao, et al.
Veröffentlicht: (2025)
von: Wang, Ziyao, et al.
Veröffentlicht: (2025)
Confidence-Modulated Speculative Decoding for Large Language Models
von: Sen, Jaydip, et al.
Veröffentlicht: (2025)
von: Sen, Jaydip, et al.
Veröffentlicht: (2025)
Speculative Decoding Reimagined for Multimodal Large Language Models
von: Lin, Luxi, et al.
Veröffentlicht: (2025)
von: Lin, Luxi, et al.
Veröffentlicht: (2025)
Collaborative Edge-to-Server Inference for Vision-Language Models
von: Song, Soochang, et al.
Veröffentlicht: (2025)
von: Song, Soochang, et al.
Veröffentlicht: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
von: Liao, Baohao, et al.
Veröffentlicht: (2025)
von: Liao, Baohao, et al.
Veröffentlicht: (2025)
CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models
von: Cao, Zongsheng, et al.
Veröffentlicht: (2025)
von: Cao, Zongsheng, et al.
Veröffentlicht: (2025)
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
von: Arriola, Marianne, et al.
Veröffentlicht: (2025)
von: Arriola, Marianne, et al.
Veröffentlicht: (2025)
Plato: Plan to Efficiently Decode for Large Language Model Inference
von: Jin, Shuowei, et al.
Veröffentlicht: (2024)
von: Jin, Shuowei, et al.
Veröffentlicht: (2024)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
von: Liu, Dong, et al.
Veröffentlicht: (2025)
von: Liu, Dong, et al.
Veröffentlicht: (2025)
Large Language Models as Co-Pilots for Causal Inference in Medical Studies
von: Alaa, Ahmed, et al.
Veröffentlicht: (2024)
von: Alaa, Ahmed, et al.
Veröffentlicht: (2024)
Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding
von: Xiao, Bin, et al.
Veröffentlicht: (2024)
von: Xiao, Bin, et al.
Veröffentlicht: (2024)
Faster Cascades via Speculative Decoding
von: Narasimhan, Harikrishna, et al.
Veröffentlicht: (2024)
von: Narasimhan, Harikrishna, et al.
Veröffentlicht: (2024)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
von: Sun, Chendong, et al.
Veröffentlicht: (2025)
von: Sun, Chendong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
FeDeRA:Efficient Fine-tuning of Language Models in Federated Learning Leveraging Weight Decomposition
von: Yan, Yuxuan, et al.
Veröffentlicht: (2024) -
GCoDE: Efficient Device-Edge Co-Inference for GNNs via Architecture-Mapping Co-Search
von: Zhou, Ao, et al.
Veröffentlicht: (2025) -
WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference
von: Liu, Zixuan, et al.
Veröffentlicht: (2026) -
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
von: Bajpai, Divya Jyoti, et al.
Veröffentlicht: (2025) -
Dynamic-Width Speculative Beam Decoding for Efficient LLM Inference
von: Qin, Zongyue, et al.
Veröffentlicht: (2024)