Inference Compute-Optimal Video Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Peiqi, Peng, ShengYun, Zhang, Xuewen, Yu, Hanchao, Yang, Yibo, Huang, Lifu, Liu, Fujun, Wang, Qifan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
CompCap: Improving Multimodal Large Language Models with Composite Captions
por: Chen, Xiaohui, et al.
Publicado: (2024)
por: Chen, Xiaohui, et al.
Publicado: (2024)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
A Survey on Hallucination in Large Vision-Language Models
por: Liu, Hanchao, et al.
Publicado: (2024)
por: Liu, Hanchao, et al.
Publicado: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
por: Dou, Zi-Yi, et al.
Publicado: (2024)
por: Dou, Zi-Yi, et al.
Publicado: (2024)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
por: Qi, Jingyuan, et al.
Publicado: (2025)
por: Qi, Jingyuan, et al.
Publicado: (2025)
Self-Supervised Pre-Training for Table Structure Recognition Transformer
por: Peng, ShengYun, et al.
Publicado: (2024)
por: Peng, ShengYun, et al.
Publicado: (2024)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
por: Zhu, Kangyu, et al.
Publicado: (2024)
por: Zhu, Kangyu, et al.
Publicado: (2024)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
por: Wang, Zihu, et al.
Publicado: (2025)
por: Wang, Zihu, et al.
Publicado: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
Video-Based Reward Modeling for Computer-Use Agents
por: Song, Linxin, et al.
Publicado: (2026)
por: Song, Linxin, et al.
Publicado: (2026)
Inference-Time Structural Reasoning for Compositional Vision-Language Understanding
por: Bhattacharya, Amartya
Publicado: (2026)
por: Bhattacharya, Amartya
Publicado: (2026)
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
por: Zhao, Tiancheng, et al.
Publicado: (2024)
por: Zhao, Tiancheng, et al.
Publicado: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Toward Interactive Regional Understanding in Vision-Large Language Models
por: Lee, Jungbeom, et al.
Publicado: (2024)
por: Lee, Jungbeom, et al.
Publicado: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
por: Nazir, Maham, et al.
Publicado: (2026)
por: Nazir, Maham, et al.
Publicado: (2026)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
por: Woo, Sangmin, et al.
Publicado: (2025)
por: Woo, Sangmin, et al.
Publicado: (2025)
Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
por: Du, Zhenbang, et al.
Publicado: (2025)
por: Du, Zhenbang, et al.
Publicado: (2025)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
por: Hannan, Tanveer, et al.
Publicado: (2024)
por: Hannan, Tanveer, et al.
Publicado: (2024)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
por: An, Dong, et al.
Publicado: (2023)
por: An, Dong, et al.
Publicado: (2023)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024)
por: Yu, Sicheng, et al.
Publicado: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
por: Shen, Haozhan, et al.
Publicado: (2025)
por: Shen, Haozhan, et al.
Publicado: (2025)
Adaptive Vision-Language Model Routing for Computer Use Agents
por: Liu, Xunzhuo, et al.
Publicado: (2026)
por: Liu, Xunzhuo, et al.
Publicado: (2026)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
por: Wu, Xueqing, et al.
Publicado: (2026)
por: Wu, Xueqing, et al.
Publicado: (2026)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
NeMo: Needle in a Montage for Video-Language Understanding
por: Hu, Zi-Yuan, et al.
Publicado: (2025)
por: Hu, Zi-Yuan, et al.
Publicado: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
por: Wang, Ye, et al.
Publicado: (2025)
por: Wang, Ye, et al.
Publicado: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
por: Deng, Yihe, et al.
Publicado: (2024)
por: Deng, Yihe, et al.
Publicado: (2024)
Evaluating Vision-Language Models for Emotion Recognition
por: Bhattacharyya, Sree, et al.
Publicado: (2025)
por: Bhattacharyya, Sree, et al.
Publicado: (2025)
Multimodal Instruction Tuning with Conditional Mixture of LoRA
por: Shen, Ying, et al.
Publicado: (2024)
por: Shen, Ying, et al.
Publicado: (2024)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
por: Patel, Maitreya, et al.
Publicado: (2024)
por: Patel, Maitreya, et al.
Publicado: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
por: Lin, Jingyang, et al.
Publicado: (2025)
por: Lin, Jingyang, et al.
Publicado: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
por: Deng, Yihe, et al.
Publicado: (2025)
por: Deng, Yihe, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a Service
por: Wang, Xiasi, et al.
Publicado: (2025)
por: Wang, Xiasi, et al.
Publicado: (2025)
Ejemplares similares
-
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
por: Xu, Zhiyang, et al.
Publicado: (2024) -
CompCap: Improving Multimodal Large Language Models with Composite Captions
por: Chen, Xiaohui, et al.
Publicado: (2024) -
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
por: Xu, Zhiyang, et al.
Publicado: (2024) -
A Survey on Hallucination in Large Vision-Language Models
por: Liu, Hanchao, et al.
Publicado: (2024) -
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)