Can Multimodal Large Language Models Truly Understand Small Objects?
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Fujun, Chen, Junan, Zhu, Xintong, Ye, Jingqi, Mao, Xuanjie, Chen, Tao, Ye, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
por: Chen, Shuo, et al.
Publicado: (2023)
por: Chen, Shuo, et al.
Publicado: (2023)
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023)
por: Zang, Yuhang, et al.
Publicado: (2023)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
por: Li, Hengzhuang, et al.
Publicado: (2025)
por: Li, Hengzhuang, et al.
Publicado: (2025)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026)
por: Chen, Tao, et al.
Publicado: (2026)
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
por: Zhang, Lina, et al.
Publicado: (2026)
por: Zhang, Lina, et al.
Publicado: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
por: Bao, Han, et al.
Publicado: (2024)
por: Bao, Han, et al.
Publicado: (2024)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
por: Li, Qingmei, et al.
Publicado: (2025)
por: Li, Qingmei, et al.
Publicado: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
por: Deng, Weipeng, et al.
Publicado: (2024)
por: Deng, Weipeng, et al.
Publicado: (2024)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
por: Li, Yinghui, et al.
Publicado: (2026)
por: Li, Yinghui, et al.
Publicado: (2026)
Triple-domain Feature Learning with Frequency-aware Memory Enhancement for Moving Infrared Small Target Detection
por: Duan, Weiwei, et al.
Publicado: (2024)
por: Duan, Weiwei, et al.
Publicado: (2024)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
por: Li, Jiansheng, et al.
Publicado: (2025)
por: Li, Jiansheng, et al.
Publicado: (2025)
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
por: Ye, Sen, et al.
Publicado: (2026)
por: Ye, Sen, et al.
Publicado: (2026)
TRINS: Towards Multimodal Language Models that Can Read
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
por: Tan, Zhangyun, et al.
Publicado: (2026)
por: Tan, Zhangyun, et al.
Publicado: (2026)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
por: Xu, Jingqi
Publicado: (2026)
por: Xu, Jingqi
Publicado: (2026)
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
por: Xu, Boshen, et al.
Publicado: (2024)
por: Xu, Boshen, et al.
Publicado: (2024)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
por: Chen, Junwen, et al.
Publicado: (2025)
por: Chen, Junwen, et al.
Publicado: (2025)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
por: Song, Shezheng, et al.
Publicado: (2024)
por: Song, Shezheng, et al.
Publicado: (2024)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
por: Jung, Ji Hyeok, et al.
Publicado: (2024)
por: Jung, Ji Hyeok, et al.
Publicado: (2024)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
por: Yang, Qu, et al.
Publicado: (2024)
por: Yang, Qu, et al.
Publicado: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
por: Zhu, Younan, et al.
Publicado: (2025)
por: Zhu, Younan, et al.
Publicado: (2025)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
por: Chen, Haoyu, et al.
Publicado: (2024)
por: Chen, Haoyu, et al.
Publicado: (2024)
Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models
por: Chen, Qiuhui, et al.
Publicado: (2025)
por: Chen, Qiuhui, et al.
Publicado: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
Large Language Models Can Understanding Depth from Monocular Images
por: Xia, Zhongyi, et al.
Publicado: (2024)
por: Xia, Zhongyi, et al.
Publicado: (2024)
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
por: Li, Kangcong, et al.
Publicado: (2026)
por: Li, Kangcong, et al.
Publicado: (2026)
Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning
por: Yu, Zhenyu, et al.
Publicado: (2026)
por: Yu, Zhenyu, et al.
Publicado: (2026)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
por: Lu, Shiyin, et al.
Publicado: (2024)
por: Lu, Shiyin, et al.
Publicado: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
por: Zhang, Zhenhao, et al.
Publicado: (2025)
por: Zhang, Zhenhao, et al.
Publicado: (2025)
Can We Edit Multimodal Large Language Models?
por: Cheng, Siyuan, et al.
Publicado: (2023)
por: Cheng, Siyuan, et al.
Publicado: (2023)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
por: Ye, Zhipeng, et al.
Publicado: (2026)
por: Ye, Zhipeng, et al.
Publicado: (2026)
Review of Hallucination Understanding in Large Language and Vision Models
por: Ho, Zhengyi, et al.
Publicado: (2025)
por: Ho, Zhengyi, et al.
Publicado: (2025)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
por: Fang, Chengyu, et al.
Publicado: (2026)
por: Fang, Chengyu, et al.
Publicado: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
por: Zou, Junbo, et al.
Publicado: (2025)
por: Zou, Junbo, et al.
Publicado: (2025)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
por: Tu, Chongjun, et al.
Publicado: (2025)
por: Tu, Chongjun, et al.
Publicado: (2025)
GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models
por: Ye, Zhankai, et al.
Publicado: (2026)
por: Ye, Zhankai, et al.
Publicado: (2026)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
por: Wang, Yizhou, et al.
Publicado: (2025)
por: Wang, Yizhou, et al.
Publicado: (2025)
Personalized Video Summarization by Multimodal Video Understanding
por: Chen, Brian, et al.
Publicado: (2024)
por: Chen, Brian, et al.
Publicado: (2024)
Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models
por: Peng, Ruiying, et al.
Publicado: (2026)
por: Peng, Ruiying, et al.
Publicado: (2026)
Ejemplares similares
-
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
por: Chen, Shuo, et al.
Publicado: (2023) -
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023) -
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
por: Li, Hengzhuang, et al.
Publicado: (2025) -
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026) -
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
por: Zhang, Lina, et al.
Publicado: (2026)