Efficient Architectures for High Resolution Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Carvalho, Miguel, Martins, Bruno |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
por: Carvalho, Miguel, et al.
Publicado: (2025)
por: Carvalho, Miguel, et al.
Publicado: (2025)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
por: Lee, Jewon, et al.
Publicado: (2025)
por: Lee, Jewon, et al.
Publicado: (2025)
Small Vision-Language Models: A Survey on Compact Architectures and Techniques
por: Patnaik, Nitesh, et al.
Publicado: (2025)
por: Patnaik, Nitesh, et al.
Publicado: (2025)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
por: Panos, Aristeidis, et al.
Publicado: (2024)
por: Panos, Aristeidis, et al.
Publicado: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)
por: Yang, Senqiao, et al.
Publicado: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Efficient Contrastive Decoding with Probabilistic Hallucination Detection - Mitigating Hallucinations in Large Vision Language Models -
por: Fieback, Laura, et al.
Publicado: (2025)
por: Fieback, Laura, et al.
Publicado: (2025)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
por: Sung, Yi-Lin, et al.
Publicado: (2023)
por: Sung, Yi-Lin, et al.
Publicado: (2023)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
por: Yang, Senqiao, et al.
Publicado: (2024)
por: Yang, Senqiao, et al.
Publicado: (2024)
VLSM-Adapter: Finetuning Vision-Language Segmentation Efficiently with Lightweight Blocks
por: Dhakal, Manish, et al.
Publicado: (2024)
por: Dhakal, Manish, et al.
Publicado: (2024)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
por: Nguyen, Phu-Vinh, et al.
Publicado: (2025)
por: Nguyen, Phu-Vinh, et al.
Publicado: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
por: Huang, Wenxuan, et al.
Publicado: (2024)
por: Huang, Wenxuan, et al.
Publicado: (2024)
Vision-Language Model Based Handwriting Verification
por: Chauhan, Mihir, et al.
Publicado: (2024)
por: Chauhan, Mihir, et al.
Publicado: (2024)
Differentiable Prompt Learning for Vision Language Models
por: Huang, Zhenhan, et al.
Publicado: (2024)
por: Huang, Zhenhan, et al.
Publicado: (2024)
How Culturally Aware are Vision-Language Models?
por: Burda-Lassen, Olena, et al.
Publicado: (2024)
por: Burda-Lassen, Olena, et al.
Publicado: (2024)
VLCD: Vision-Language Contrastive Distillation for Accurate and Efficient Automatic Placenta Analysis
por: Mehta, Manas, et al.
Publicado: (2025)
por: Mehta, Manas, et al.
Publicado: (2025)
Efficient Benchmarking of Language Models
por: Perlitz, Yotam, et al.
Publicado: (2023)
por: Perlitz, Yotam, et al.
Publicado: (2023)
Mordal: Automated Pretrained Model Selection for Vision Language Models
por: He, Shiqi, et al.
Publicado: (2025)
por: He, Shiqi, et al.
Publicado: (2025)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
por: Bae, Jiyun, et al.
Publicado: (2025)
por: Bae, Jiyun, et al.
Publicado: (2025)
Coordinated Robustness Evaluation Framework for Vision-Language Models
por: Babu, Ashwin Ramesh, et al.
Publicado: (2025)
por: Babu, Ashwin Ramesh, et al.
Publicado: (2025)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
por: Lavoie, Samuel, et al.
Publicado: (2024)
por: Lavoie, Samuel, et al.
Publicado: (2024)
PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding
por: Kuzucu, Selim, et al.
Publicado: (2026)
por: Kuzucu, Selim, et al.
Publicado: (2026)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
por: Li, YuQian, et al.
Publicado: (2025)
por: Li, YuQian, et al.
Publicado: (2025)
Linear Spaces of Meanings: Compositional Structures in Vision-Language Models
por: Trager, Matthew, et al.
Publicado: (2023)
por: Trager, Matthew, et al.
Publicado: (2023)
MouSi: Poly-Visual-Expert Vision-Language Models
por: Fan, Xiaoran, et al.
Publicado: (2024)
por: Fan, Xiaoran, et al.
Publicado: (2024)
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
por: Fu, Shuai, et al.
Publicado: (2024)
por: Fu, Shuai, et al.
Publicado: (2024)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
por: Cherian, Anoop, et al.
Publicado: (2024)
por: Cherian, Anoop, et al.
Publicado: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
por: Qiu, Yifu, et al.
Publicado: (2026)
por: Qiu, Yifu, et al.
Publicado: (2026)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
VisPlay: Self-Evolving Vision-Language Models from Images
por: He, Yicheng, et al.
Publicado: (2025)
por: He, Yicheng, et al.
Publicado: (2025)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
por: Zhou, Yucheng, et al.
Publicado: (2025)
por: Zhou, Yucheng, et al.
Publicado: (2025)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
por: Li, Chen-An, et al.
Publicado: (2025)
por: Li, Chen-An, et al.
Publicado: (2025)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
por: Abid, Abderrazek, et al.
Publicado: (2025)
por: Abid, Abderrazek, et al.
Publicado: (2025)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
por: Maharana, Adyasha, et al.
Publicado: (2023)
por: Maharana, Adyasha, et al.
Publicado: (2023)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
por: Wu, Junjie, et al.
Publicado: (2024)
por: Wu, Junjie, et al.
Publicado: (2024)
Ejemplares similares
-
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
por: Carvalho, Miguel, et al.
Publicado: (2025) -
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
por: Lee, Jewon, et al.
Publicado: (2025) -
Small Vision-Language Models: A Survey on Compact Architectures and Techniques
por: Patnaik, Nitesh, et al.
Publicado: (2025) -
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
por: Panos, Aristeidis, et al.
Publicado: (2024) -
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)