Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Jun, Ji, Yicheng, Ren, Feiyang, Li, Yihang, Zeng, Bowen, Chen, Zonghao, Chen, Ke, Shou, Lidan, Chen, Gang, Li, Huan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
by: Zeng, Bowen, et al.
Published: (2026)
by: Zeng, Bowen, et al.
Published: (2026)
See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
by: Ji, Yicheng, et al.
Published: (2026)
by: Ji, Yicheng, et al.
Published: (2026)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
by: Zhang, Jun, et al.
Published: (2023)
by: Zhang, Jun, et al.
Published: (2023)
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
by: Ji, Yicheng, et al.
Published: (2025)
by: Ji, Yicheng, et al.
Published: (2025)
KcMF: A Knowledge-compliant Framework for Schema and Entity Matching with Fine-tuning-free LLMs
by: Xu, Yongqin, et al.
Published: (2024)
by: Xu, Yongqin, et al.
Published: (2024)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
Tabular Data Augmentation for Machine Learning: Progress and Prospects of Embracing Generative AI
by: Cui, Lingxi, et al.
Published: (2024)
by: Cui, Lingxi, et al.
Published: (2024)
NLCTables: A Dataset for Marrying Natural Language Conditions with Table Discovery
by: Cui, Lingxi, et al.
Published: (2025)
by: Cui, Lingxi, et al.
Published: (2025)
TableCopilot: A Table Assistant Empowered by Natural Language Conditional Table Discovery
by: Cui, Lingxi, et al.
Published: (2025)
by: Cui, Lingxi, et al.
Published: (2025)
Membership Inference Attacks against Large Vision-Language Models
by: Li, Zhan, et al.
Published: (2024)
by: Li, Zhan, et al.
Published: (2024)
RedParrot: Accelerating NL-to-DSL for Business Analytics via Query Semantic Caching
by: Wang, Tong, et al.
Published: (2026)
by: Wang, Tong, et al.
Published: (2026)
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
by: Ren, Jie, et al.
Published: (2024)
by: Ren, Jie, et al.
Published: (2024)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
by: Sun, Yirong, et al.
Published: (2026)
by: Sun, Yirong, et al.
Published: (2026)
CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion Recognition
by: Peng, Cheng, et al.
Published: (2023)
by: Peng, Cheng, et al.
Published: (2023)
A Statistical and Multi-Perspective Revisiting of the Membership Inference Attack in Large Language Models
by: Chen, Bowen, et al.
Published: (2024)
by: Chen, Bowen, et al.
Published: (2024)
Token-Efficient Leverage Learning in Large Language Models
by: Zeng, Yuanhao, et al.
Published: (2024)
by: Zeng, Yuanhao, et al.
Published: (2024)
AutoNeural: Co-Designing Vision-Language Models for NPU Inference
by: Chen, Wei, et al.
Published: (2025)
by: Chen, Wei, et al.
Published: (2025)
DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning
by: Li, Feiyang, et al.
Published: (2026)
by: Li, Feiyang, et al.
Published: (2026)
FlashDecoding++: Faster Large Language Model Inference on GPUs
by: Hong, Ke, et al.
Published: (2023)
by: Hong, Ke, et al.
Published: (2023)
Preventing the Popular Item Embedding Based Attack in Federated Recommendations
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
CHASe: Client Heterogeneity-Aware Data Selection for Effective Federated Active Learning
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
SVFusion: A CPU-GPU Co-Processing Architecture for Large-Scale Real-Time Vector Search
by: Peng, Yuchen, et al.
Published: (2026)
by: Peng, Yuchen, et al.
Published: (2026)
Retcon -- a Prompt-Based Technique for Precise Control of LLMs in Conversations
by: Kogan, David, et al.
Published: (2026)
by: Kogan, David, et al.
Published: (2026)
KG-Rank: Enhancing Large Language Models for Medical QA with Knowledge Graphs and Ranking Techniques
by: Yang, Rui, et al.
Published: (2024)
by: Yang, Rui, et al.
Published: (2024)
DELIA: Diversity-Enhanced Learning for Instruction Adaptation in Large Language Models
by: Zeng, Yuanhao, et al.
Published: (2024)
by: Zeng, Yuanhao, et al.
Published: (2024)
FL-GUARD: A Holistic Framework for Run-Time Detection and Recovery of Negative Federated Learning
by: Lin, Hong, et al.
Published: (2024)
by: Lin, Hong, et al.
Published: (2024)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
by: Qi, Biqing, et al.
Published: (2024)
by: Qi, Biqing, et al.
Published: (2024)
Efficient Inference for Large Reasoning Models: A Survey
by: Liu, Yue, et al.
Published: (2025)
by: Liu, Yue, et al.
Published: (2025)
A Survey on Efficient Inference for Large Language Models
by: Zhou, Zixuan, et al.
Published: (2024)
by: Zhou, Zixuan, et al.
Published: (2024)
A Survey on Hallucination in Large Vision-Language Models
by: Liu, Hanchao, et al.
Published: (2024)
by: Liu, Hanchao, et al.
Published: (2024)
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
by: Chen, Guoxuan, et al.
Published: (2024)
by: Chen, Guoxuan, et al.
Published: (2024)
Simple Techniques for Enhancing Sentence Embeddings in Generative Language Models
by: Zhang, Bowen, et al.
Published: (2024)
by: Zhang, Bowen, et al.
Published: (2024)
Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference
by: Chen, Zhuo, et al.
Published: (2025)
by: Chen, Zhuo, et al.
Published: (2025)
Contextualization Distillation from Large Language Model for Knowledge Graph Completion
by: Li, Dawei, et al.
Published: (2024)
by: Li, Dawei, et al.
Published: (2024)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
by: Xiao, Sibo, et al.
Published: (2025)
by: Xiao, Sibo, et al.
Published: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
by: Zou, Xiaotian, et al.
Published: (2024)
by: Zou, Xiaotian, et al.
Published: (2024)
ConPET: Continual Parameter-Efficient Tuning for Large Language Models
by: Song, Chenyang, et al.
Published: (2023)
by: Song, Chenyang, et al.
Published: (2023)
ART: Attention Run-time Termination for Efficient Large Language Model Decoding
by: Qiu, Chen, et al.
Published: (2026)
by: Qiu, Chen, et al.
Published: (2026)
Efficient Response Generation Strategy Selection for Fine-Tuning Large Language Models Through Self-Aligned Perplexity
by: Ren, Xuan, et al.
Published: (2025)
by: Ren, Xuan, et al.
Published: (2025)
Similar Items
-
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
by: Zeng, Bowen, et al.
Published: (2026) -
See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
by: Ji, Yicheng, et al.
Published: (2026) -
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
by: Zhang, Jun, et al.
Published: (2023) -
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
by: Zhang, Jun, et al.
Published: (2025) -
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
by: Ji, Yicheng, et al.
Published: (2025)