The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tan, Yuwen, Qing, Yuan, Gong, Boqing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Continual Adapter Tuning with Semantic Shift Compensation for Class-Incremental Learning
von: Zhou, Qinhao, et al.
Veröffentlicht: (2024)
von: Zhou, Qinhao, et al.
Veröffentlicht: (2024)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025)
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025)
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
von: Tan, Yuwen, et al.
Veröffentlicht: (2025)
von: Tan, Yuwen, et al.
Veröffentlicht: (2025)
Multimodal LLMs Struggle with Basic Visual Network Analysis: a VNA Benchmark
von: Williams, Evan M., et al.
Veröffentlicht: (2024)
von: Williams, Evan M., et al.
Veröffentlicht: (2024)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
von: Tartaglini, Alexa R., et al.
Veröffentlicht: (2025)
von: Tartaglini, Alexa R., et al.
Veröffentlicht: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
von: Nagar, Aishik, et al.
Veröffentlicht: (2024)
von: Nagar, Aishik, et al.
Veröffentlicht: (2024)
Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
von: Jian, Yichang, et al.
Veröffentlicht: (2026)
von: Jian, Yichang, et al.
Veröffentlicht: (2026)
On Discrete Prompt Optimization for Diffusion Models
von: Wang, Ruochen, et al.
Veröffentlicht: (2024)
von: Wang, Ruochen, et al.
Veröffentlicht: (2024)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
von: Chen, Junying, et al.
Veröffentlicht: (2024)
von: Chen, Junying, et al.
Veröffentlicht: (2024)
BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning
von: Wang, Shengao, et al.
Veröffentlicht: (2025)
von: Wang, Shengao, et al.
Veröffentlicht: (2025)
Why are Visually-Grounded Language Models Bad at Image Classification?
von: Zhang, Yuhui, et al.
Veröffentlicht: (2024)
von: Zhang, Yuhui, et al.
Veröffentlicht: (2024)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
Lightweight Operations for Visual Speech Recognition
von: Panagos, Iason Ioannis, et al.
Veröffentlicht: (2025)
von: Panagos, Iason Ioannis, et al.
Veröffentlicht: (2025)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
von: Deng, Ken, et al.
Veröffentlicht: (2026)
von: Deng, Ken, et al.
Veröffentlicht: (2026)
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
von: Wang, Yimu, et al.
Veröffentlicht: (2025)
von: Wang, Yimu, et al.
Veröffentlicht: (2025)
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
von: Vaishnav, Mohit, et al.
Veröffentlicht: (2026)
von: Vaishnav, Mohit, et al.
Veröffentlicht: (2026)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
von: Yuan, Qianhao, et al.
Veröffentlicht: (2026)
von: Yuan, Qianhao, et al.
Veröffentlicht: (2026)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
von: Fu, Xingyu, et al.
Veröffentlicht: (2023)
von: Fu, Xingyu, et al.
Veröffentlicht: (2023)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning
von: Zala, Abhay, et al.
Veröffentlicht: (2023)
von: Zala, Abhay, et al.
Veröffentlicht: (2023)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
von: Abid, Abderrazek, et al.
Veröffentlicht: (2025)
von: Abid, Abderrazek, et al.
Veröffentlicht: (2025)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
von: Gado, Mohamed, et al.
Veröffentlicht: (2025)
von: Gado, Mohamed, et al.
Veröffentlicht: (2025)
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
von: Liu, Anjie, et al.
Veröffentlicht: (2026)
von: Liu, Anjie, et al.
Veröffentlicht: (2026)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
von: Zou, Henry Peng, et al.
Veröffentlicht: (2024)
von: Zou, Henry Peng, et al.
Veröffentlicht: (2024)
LLM Augmented LLMs: Expanding Capabilities through Composition
von: Bansal, Rachit, et al.
Veröffentlicht: (2024)
von: Bansal, Rachit, et al.
Veröffentlicht: (2024)
Deep Learning-Based Digitization of Overlapping ECG Images with Open-Source Python Code
von: Karbasi, Reza, et al.
Veröffentlicht: (2025)
von: Karbasi, Reza, et al.
Veröffentlicht: (2025)
Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition
von: Choi, Dasol, et al.
Veröffentlicht: (2025)
von: Choi, Dasol, et al.
Veröffentlicht: (2025)
MouSi: Poly-Visual-Expert Vision-Language Models
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
Why Do Vision Language Models Struggle To Recognize Human Emotions?
von: Agarwal, Madhav, et al.
Veröffentlicht: (2026)
von: Agarwal, Madhav, et al.
Veröffentlicht: (2026)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
von: Nguyen, Phu-Vinh, et al.
Veröffentlicht: (2025)
von: Nguyen, Phu-Vinh, et al.
Veröffentlicht: (2025)
NVLM: Open Frontier-Class Multimodal LLMs
von: Dai, Wenliang, et al.
Veröffentlicht: (2024)
von: Dai, Wenliang, et al.
Veröffentlicht: (2024)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
von: Lee, Jewon, et al.
Veröffentlicht: (2025)
von: Lee, Jewon, et al.
Veröffentlicht: (2025)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
von: Prasad, Archiki, et al.
Veröffentlicht: (2023)
von: Prasad, Archiki, et al.
Veröffentlicht: (2023)
FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition
von: Xian, Ruiqi, et al.
Veröffentlicht: (2024)
von: Xian, Ruiqi, et al.
Veröffentlicht: (2024)
Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology Videos
von: Seyfioglu, Mehmet Saygin, et al.
Veröffentlicht: (2023)
von: Seyfioglu, Mehmet Saygin, et al.
Veröffentlicht: (2023)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
von: He, Hulingxiao, et al.
Veröffentlicht: (2025)
von: He, Hulingxiao, et al.
Veröffentlicht: (2025)
Natural Language Generation from Visual Events: State-of-the-Art and Key Open Questions
von: Surikuchi, Aditya K, et al.
Veröffentlicht: (2025)
von: Surikuchi, Aditya K, et al.
Veröffentlicht: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
von: Lagos, Maximiliano Hormazábal, et al.
Veröffentlicht: (2025)
von: Lagos, Maximiliano Hormazábal, et al.
Veröffentlicht: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
von: Li, Bangzheng, et al.
Veröffentlicht: (2025)
von: Li, Bangzheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Continual Adapter Tuning with Semantic Shift Compensation for Class-Incremental Learning
von: Zhou, Qinhao, et al.
Veröffentlicht: (2024) -
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025) -
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
von: Tan, Yuwen, et al.
Veröffentlicht: (2025) -
Multimodal LLMs Struggle with Basic Visual Network Analysis: a VNA Benchmark
von: Williams, Evan M., et al.
Veröffentlicht: (2024) -
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
von: Tartaglini, Alexa R., et al.
Veröffentlicht: (2025)