LiteVLM: A Low-Latency Vision-Language Model Inference Pipeline for Resource-Constrained Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Jin, Jin, Yuchao, An, Le, Park, Josh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
por: Sung, Mingyu, et al.
Publicado: (2025)
por: Sung, Mingyu, et al.
Publicado: (2025)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
Progressive Weight Loading: Accelerating Initial Inference and Gradually Boosting Performance on Resource-Constrained Environments
por: Kim, Hyunwoo, et al.
Publicado: (2025)
por: Kim, Hyunwoo, et al.
Publicado: (2025)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
por: Yadav, Divakar Kumar, et al.
Publicado: (2026)
por: Yadav, Divakar Kumar, et al.
Publicado: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
por: Chen, Huamin, et al.
Publicado: (2026)
por: Chen, Huamin, et al.
Publicado: (2026)
Fed-SE: Federated Self-Evolution for Privacy-Constrained Multi-Environment LLM Agents
por: Chen, Xiang, et al.
Publicado: (2025)
por: Chen, Xiang, et al.
Publicado: (2025)
CF-VLM:CounterFactual Vision-Language Fine-tuning
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
por: Zhao, Yushang, et al.
Publicado: (2025)
por: Zhao, Yushang, et al.
Publicado: (2025)
SACO: Sequence-Aware Constrained Optimization Framework for Coupon Distribution in E-commerce
por: Kong, Li, et al.
Publicado: (2025)
por: Kong, Li, et al.
Publicado: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
por: Almurshed, Osama, et al.
Publicado: (2025)
por: Almurshed, Osama, et al.
Publicado: (2025)
Why Inference in Large Models Becomes Decomposable After Training
por: Jin, Jidong
Publicado: (2026)
por: Jin, Jidong
Publicado: (2026)
Logarithmic Memory Networks (LMNs): Efficient Long-Range Sequence Modeling for Resource-Constrained Environments
por: Taha, Mohamed A.
Publicado: (2025)
por: Taha, Mohamed A.
Publicado: (2025)
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
por: Wang, Yufei, et al.
Publicado: (2024)
por: Wang, Yufei, et al.
Publicado: (2024)
Perturb-and-Compare Approach for Detecting Out-of-Distribution Samples in Constrained Access Environments
por: Lee, Heeyoung, et al.
Publicado: (2024)
por: Lee, Heeyoung, et al.
Publicado: (2024)
Pipeline Analysis for Developing Instruct LLMs in Low-Resource Languages: A Case Study on Basque
por: Corral, Ander, et al.
Publicado: (2024)
por: Corral, Ander, et al.
Publicado: (2024)
WildFit: Autonomous In-situ Model Adaptation for Resource-Constrained IoT Systems
por: Rastikerdar, Mohammad Mehdi, et al.
Publicado: (2024)
por: Rastikerdar, Mohammad Mehdi, et al.
Publicado: (2024)
Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs
por: Abillama, Pierre, et al.
Publicado: (2025)
por: Abillama, Pierre, et al.
Publicado: (2025)
Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques
por: Girija, Sanjay Surendranath, et al.
Publicado: (2025)
por: Girija, Sanjay Surendranath, et al.
Publicado: (2025)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
por: Jin, Ruofan, et al.
Publicado: (2026)
por: Jin, Ruofan, et al.
Publicado: (2026)
Easy Adaptation: An Efficient Task-Specific Knowledge Injection Method for Large Models in Resource-Constrained Environments
por: Chen, Dong, et al.
Publicado: (2025)
por: Chen, Dong, et al.
Publicado: (2025)
Leveraging Knowledge Distillation for Efficient Deep Reinforcement Learning in Resource-Constrained Environments
por: Meng, Guanlin
Publicado: (2023)
por: Meng, Guanlin
Publicado: (2023)
Efficient Zero-Order Federated Finetuning of Language Models for Resource-Constrained Devices
por: Ahmed, Mohamed Aboelenien, et al.
Publicado: (2025)
por: Ahmed, Mohamed Aboelenien, et al.
Publicado: (2025)
The M-factor: A Novel Metric for Evaluating Neural Architecture Search in Resource-Constrained Environments
por: Thudumu, Srikanth, et al.
Publicado: (2025)
por: Thudumu, Srikanth, et al.
Publicado: (2025)
Beam Prediction based on Large Language Models
por: Sheng, Yucheng, et al.
Publicado: (2024)
por: Sheng, Yucheng, et al.
Publicado: (2024)
SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models
por: Kapadnis, Manav Nitin, et al.
Publicado: (2024)
por: Kapadnis, Manav Nitin, et al.
Publicado: (2024)
Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
por: Ganescu, Bianca-Mihaela, et al.
Publicado: (2025)
por: Ganescu, Bianca-Mihaela, et al.
Publicado: (2025)
V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models
por: You, Junwei, et al.
Publicado: (2024)
por: You, Junwei, et al.
Publicado: (2024)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
FL-NAS: Towards Fairness of NAS for Resource Constrained Devices via Large Language Models
por: Qin, Ruiyang, et al.
Publicado: (2024)
por: Qin, Ruiyang, et al.
Publicado: (2024)
On Accelerating Edge AI: Optimizing Resource-Constrained Environments
por: Sander, Jacob, et al.
Publicado: (2025)
por: Sander, Jacob, et al.
Publicado: (2025)
Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models
por: Fu, Yonggan, et al.
Publicado: (2025)
por: Fu, Yonggan, et al.
Publicado: (2025)
Understanding Asynchronous Inference Methods for Vision-Language-Action Models
por: Agouzoul, Ayoub
Publicado: (2026)
por: Agouzoul, Ayoub
Publicado: (2026)
Efficient Low Rank Attention for Long-Context Inference in Large Language Models
por: Li, Tenghui, et al.
Publicado: (2025)
por: Li, Tenghui, et al.
Publicado: (2025)
A Resource-Adaptive Approach for Federated Learning under Resource-Constrained Environments
por: Zhang, Ruirui, et al.
Publicado: (2024)
por: Zhang, Ruirui, et al.
Publicado: (2024)
State-Constrained Offline Reinforcement Learning
por: Hepburn, Charles A., et al.
Publicado: (2024)
por: Hepburn, Charles A., et al.
Publicado: (2024)
Representations learnt by SGD and Adaptive learning rules: Conditions that vary sparsity and selectivity in neural networks
por: Park, Jin Hyun
Publicado: (2022)
por: Park, Jin Hyun
Publicado: (2022)
Resource-Constrained Affect Modelling via Variance Regularisation Pruning
por: Pinitas, Kosmas, et al.
Publicado: (2026)
por: Pinitas, Kosmas, et al.
Publicado: (2026)
3D Optimization for AI Inference Scaling: Balancing Accuracy, Cost, and Latency
por: Jung, Minseok, et al.
Publicado: (2025)
por: Jung, Minseok, et al.
Publicado: (2025)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
por: Sim, Woo Seob, et al.
Publicado: (2026)
por: Sim, Woo Seob, et al.
Publicado: (2026)
Ejemplares similares
-
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
por: Sung, Mingyu, et al.
Publicado: (2025) -
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025) -
Progressive Weight Loading: Accelerating Initial Inference and Gradually Boosting Performance on Resource-Constrained Environments
por: Kim, Hyunwoo, et al.
Publicado: (2025) -
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
por: Yadav, Divakar Kumar, et al.
Publicado: (2026) -
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
por: Chen, Huamin, et al.
Publicado: (2026)