Can Multimodal Large Language Models Truly Understand Small Objects?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Fujun, Chen, Junan, Zhu, Xintong, Ye, Jingqi, Mao, Xuanjie, Chen, Tao, Ye, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023)
par: Chen, Shuo, et autres
Publié: (2023)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
par: Li, Hengzhuang, et autres
Publié: (2025)
par: Li, Hengzhuang, et autres
Publié: (2025)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
par: Zhang, Lina, et autres
Publié: (2026)
par: Zhang, Lina, et autres
Publié: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
par: Bao, Han, et autres
Publié: (2024)
par: Bao, Han, et autres
Publié: (2024)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
par: Li, Qingmei, et autres
Publié: (2025)
par: Li, Qingmei, et autres
Publié: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
par: Deng, Weipeng, et autres
Publié: (2024)
par: Deng, Weipeng, et autres
Publié: (2024)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
par: Li, Yinghui, et autres
Publié: (2026)
par: Li, Yinghui, et autres
Publié: (2026)
Triple-domain Feature Learning with Frequency-aware Memory Enhancement for Moving Infrared Small Target Detection
par: Duan, Weiwei, et autres
Publié: (2024)
par: Duan, Weiwei, et autres
Publié: (2024)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
par: Li, Jiansheng, et autres
Publié: (2025)
par: Li, Jiansheng, et autres
Publié: (2025)
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
par: Ye, Sen, et autres
Publié: (2026)
par: Ye, Sen, et autres
Publié: (2026)
TRINS: Towards Multimodal Language Models that Can Read
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
par: Tan, Zhangyun, et autres
Publié: (2026)
par: Tan, Zhangyun, et autres
Publié: (2026)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
par: Xu, Jingqi
Publié: (2026)
par: Xu, Jingqi
Publié: (2026)
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
par: Xu, Boshen, et autres
Publié: (2024)
par: Xu, Boshen, et autres
Publié: (2024)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
par: Chen, Junwen, et autres
Publié: (2025)
par: Chen, Junwen, et autres
Publié: (2025)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
par: Song, Shezheng, et autres
Publié: (2024)
par: Song, Shezheng, et autres
Publié: (2024)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
par: Jung, Ji Hyeok, et autres
Publié: (2024)
par: Jung, Ji Hyeok, et autres
Publié: (2024)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
par: Yang, Qu, et autres
Publié: (2024)
par: Yang, Qu, et autres
Publié: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
par: Zhu, Younan, et autres
Publié: (2025)
par: Zhu, Younan, et autres
Publié: (2025)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
par: Zeng, Xingchen, et autres
Publié: (2024)
par: Zeng, Xingchen, et autres
Publié: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
par: Chen, Haoyu, et autres
Publié: (2024)
par: Chen, Haoyu, et autres
Publié: (2024)
Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models
par: Chen, Qiuhui, et autres
Publié: (2025)
par: Chen, Qiuhui, et autres
Publié: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Large Language Models Can Understanding Depth from Monocular Images
par: Xia, Zhongyi, et autres
Publié: (2024)
par: Xia, Zhongyi, et autres
Publié: (2024)
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
par: Li, Kangcong, et autres
Publié: (2026)
par: Li, Kangcong, et autres
Publié: (2026)
Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning
par: Yu, Zhenyu, et autres
Publié: (2026)
par: Yu, Zhenyu, et autres
Publié: (2026)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
par: Zhang, Zhenhao, et autres
Publié: (2025)
par: Zhang, Zhenhao, et autres
Publié: (2025)
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023)
par: Cheng, Siyuan, et autres
Publié: (2023)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
par: Ye, Zhipeng, et autres
Publié: (2026)
par: Ye, Zhipeng, et autres
Publié: (2026)
Review of Hallucination Understanding in Large Language and Vision Models
par: Ho, Zhengyi, et autres
Publié: (2025)
par: Ho, Zhengyi, et autres
Publié: (2025)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
par: Fang, Chengyu, et autres
Publié: (2026)
par: Fang, Chengyu, et autres
Publié: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
par: Zou, Junbo, et autres
Publié: (2025)
par: Zou, Junbo, et autres
Publié: (2025)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models
par: Ye, Zhankai, et autres
Publié: (2026)
par: Ye, Zhankai, et autres
Publié: (2026)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
par: Wang, Yizhou, et autres
Publié: (2025)
par: Wang, Yizhou, et autres
Publié: (2025)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models
par: Peng, Ruiying, et autres
Publié: (2026)
par: Peng, Ruiying, et autres
Publié: (2026)
Documents similaires
-
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023) -
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023) -
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
par: Li, Hengzhuang, et autres
Publié: (2025) -
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026) -
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
par: Zhang, Lina, et autres
Publié: (2026)