Exploring Perceptual Limitation of Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jiarui, Hu, Jinyi, Khayatkhoei, Mahyar, Ilievski, Filip, Sun, Maosong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Reasoning Limitations of Multimodal Large Language Models. A Case Study of Bongard Problems
par: Małkiński, Mikołaj, et autres
Publié: (2024)
par: Małkiński, Mikołaj, et autres
Publié: (2024)
ManiFPT: Defining and Analyzing Fingerprints of Generative Models
par: Song, Hae Jin, et autres
Publié: (2024)
par: Song, Hae Jin, et autres
Publié: (2024)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
par: Liu, Zhongye, et autres
Publié: (2024)
par: Liu, Zhongye, et autres
Publié: (2024)
Diffusion Model with Perceptual Loss
par: Lin, Shanchuan, et autres
Publié: (2023)
par: Lin, Shanchuan, et autres
Publié: (2023)
A Survey on Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023)
par: Chen, Shuo, et autres
Publié: (2023)
Learning to Inference Adaptively for Multimodal Large Language Models
par: Xu, Zhuoyan, et autres
Publié: (2025)
par: Xu, Zhuoyan, et autres
Publié: (2025)
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
par: Liu, Anjie, et autres
Publié: (2026)
par: Liu, Anjie, et autres
Publié: (2026)
CompCap: Improving Multimodal Large Language Models with Composite Captions
par: Chen, Xiaohui, et autres
Publié: (2024)
par: Chen, Xiaohui, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Causal Decoding for Hallucination-Resistant Multimodal Large Language Models
par: Tan, Shiwei, et autres
Publié: (2026)
par: Tan, Shiwei, et autres
Publié: (2026)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
par: Cai, Rui, et autres
Publié: (2025)
par: Cai, Rui, et autres
Publié: (2025)
Woodpecker: Hallucination Correction for Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
par: Muhtar, Dilxat, et autres
Publié: (2024)
par: Muhtar, Dilxat, et autres
Publié: (2024)
Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models
par: Chen, Zijun, et autres
Publié: (2024)
par: Chen, Zijun, et autres
Publié: (2024)
LEGENT: Open Platform for Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2024)
par: Cheng, Zhili, et autres
Publié: (2024)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
par: Miao, Yanting, et autres
Publié: (2026)
par: Miao, Yanting, et autres
Publié: (2026)
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
par: Hong, Yunqi, et autres
Publié: (2025)
par: Hong, Yunqi, et autres
Publié: (2025)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
Exploring Model Kinship for Merging Large Language Models
par: Hu, Yedi, et autres
Publié: (2024)
par: Hu, Yedi, et autres
Publié: (2024)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
par: Zhang, Ziyi, et autres
Publié: (2025)
par: Zhang, Ziyi, et autres
Publié: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
Diagnosing Shoulder Disorders Using Multimodal Large Language Models and Consumer-Grade Cameras
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
Perceptual Quality-based Model Training under Annotator Label Uncertainty
par: Zhou, Chen, et autres
Publié: (2024)
par: Zhou, Chen, et autres
Publié: (2024)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
par: Yang, Haobo, et autres
Publié: (2025)
par: Yang, Haobo, et autres
Publié: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
par: Wang, Hengyi, et autres
Publié: (2024)
par: Wang, Hengyi, et autres
Publié: (2024)
MageBench: Bridging Large Multimodal Models to Agents
par: Zhang, Miaosen, et autres
Publié: (2024)
par: Zhang, Miaosen, et autres
Publié: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Exploring the Stability Gap in Continual Learning: The Role of the Classification Head
par: Łapacz, Wojciech, et autres
Publié: (2024)
par: Łapacz, Wojciech, et autres
Publié: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
par: Agarwal, Sakshi, et autres
Publié: (2026)
par: Agarwal, Sakshi, et autres
Publié: (2026)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
par: Park, Yeji, et autres
Publié: (2024)
par: Park, Yeji, et autres
Publié: (2024)
Documents similaires
-
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2025) -
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023) -
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024) -
Reasoning Limitations of Multimodal Large Language Models. A Case Study of Bongard Problems
par: Małkiński, Mikołaj, et autres
Publié: (2024) -
ManiFPT: Defining and Analyzing Fingerprints of Generative Models
par: Song, Hae Jin, et autres
Publié: (2024)