Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Haiqi, Li, Jinzhe, Li, Gengxu, Chang, Yi, Wu, Yuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Refining Critical Thinking in LLM Code Generation: A Faulty Premise-based Evaluation Framework
by: Li, Jialin, et al.
Published: (2025)
by: Li, Jialin, et al.
Published: (2025)
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
by: Li, Jinzhe, et al.
Published: (2025)
by: Li, Jinzhe, et al.
Published: (2025)
Asymmetric Co-Training for Source-Free Few-Shot Domain Adaptation
by: Li, Gengxu, et al.
Published: (2025)
by: Li, Gengxu, et al.
Published: (2025)
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
by: Wang, Ziyue, et al.
Published: (2024)
by: Wang, Ziyue, et al.
Published: (2024)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
by: Peng, Tianfan, et al.
Published: (2025)
by: Peng, Tianfan, et al.
Published: (2025)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
by: Zhang, Daoan, et al.
Published: (2024)
by: Zhang, Daoan, et al.
Published: (2024)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
by: Li, Chenxu, et al.
Published: (2025)
by: Li, Chenxu, et al.
Published: (2025)
Sketch Input Method Editor: A Comprehensive Dataset and Methodology for Systematic Input Recognition
by: Zhu, Guangming, et al.
Published: (2023)
by: Zhu, Guangming, et al.
Published: (2023)
MMR: Evaluating Reading Ability of Large Multimodal Models
by: Chen, Jian, et al.
Published: (2024)
by: Chen, Jian, et al.
Published: (2024)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
by: Li, Lingyao, et al.
Published: (2025)
by: Li, Lingyao, et al.
Published: (2025)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
by: Chen, Feng, et al.
Published: (2024)
by: Chen, Feng, et al.
Published: (2024)
Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security
by: Fan, Yihe, et al.
Published: (2024)
by: Fan, Yihe, et al.
Published: (2024)
Preemptive Hallucination Reduction: An Input-Level Approach for Multimodal Language Model
by: Arif, Nokimul Hasan, et al.
Published: (2025)
by: Arif, Nokimul Hasan, et al.
Published: (2025)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
by: Ding, Peng, et al.
Published: (2024)
by: Ding, Peng, et al.
Published: (2024)
Can Bayesian Neural Networks Explicitly Model Input Uncertainty?
by: Valdenegro-Toro, Matias, et al.
Published: (2025)
by: Valdenegro-Toro, Matias, et al.
Published: (2025)
Idea23D: Collaborative LMM Agents Enable 3D Model Generation from Interleaved Multimodal Inputs
by: Chen, Junhao, et al.
Published: (2024)
by: Chen, Junhao, et al.
Published: (2024)
iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
by: Hu, Lianyu, et al.
Published: (2024)
by: Hu, Lianyu, et al.
Published: (2024)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
by: Wang, Lehan, et al.
Published: (2025)
by: Wang, Lehan, et al.
Published: (2025)
UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation
by: Zhang, Qihui, et al.
Published: (2025)
by: Zhang, Qihui, et al.
Published: (2025)
ADMN: A Layer-Wise Adaptive Multimodal Network for Dynamic Input Noise and Compute Resources
by: Wu, Jason, et al.
Published: (2025)
by: Wu, Jason, et al.
Published: (2025)
A Systematic Analysis of Input Modalities for Fracture Classification of the Paediatric Wrist
by: Keuth, Ron, et al.
Published: (2024)
by: Keuth, Ron, et al.
Published: (2024)
Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative
by: Wang, Li, et al.
Published: (2026)
by: Wang, Li, et al.
Published: (2026)
IDArb: Intrinsic Decomposition for Arbitrary Number of Input Views and Illuminations
by: Li, Zhibing, et al.
Published: (2024)
by: Li, Zhibing, et al.
Published: (2024)
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
by: Chang, Tzu-Tao, et al.
Published: (2025)
by: Chang, Tzu-Tao, et al.
Published: (2025)
MIMONet: Multi-Input Multi-Output On-Device Deep Learning
by: Li, Zexin, et al.
Published: (2023)
by: Li, Zexin, et al.
Published: (2023)
Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models
by: Fu, Bin, et al.
Published: (2024)
by: Fu, Bin, et al.
Published: (2024)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
by: Zheng, Xiangxi, et al.
Published: (2025)
by: Zheng, Xiangxi, et al.
Published: (2025)
Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability Disproportion
by: Jiang, QingYuan, et al.
Published: (2025)
by: Jiang, QingYuan, et al.
Published: (2025)
Simulating Automotive Radar with Lidar and Camera Inputs
by: Song, Peili, et al.
Published: (2025)
by: Song, Peili, et al.
Published: (2025)
FootFormer: Estimating Stability from Visual Input
by: Kraiger, Keaton, et al.
Published: (2025)
by: Kraiger, Keaton, et al.
Published: (2025)
Stability Under Scrutiny: Benchmarking Representation Paradigms for Online HD Mapping
by: Shan, Hao, et al.
Published: (2025)
by: Shan, Hao, et al.
Published: (2025)
Pseudo-Stereo Inputs: A Solution to the Occlusion Challenge in Self-Supervised Stereo Matching
by: Yang, Ruizhi, et al.
Published: (2024)
by: Yang, Ruizhi, et al.
Published: (2024)
UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models
by: Guan, Zihan, et al.
Published: (2024)
by: Guan, Zihan, et al.
Published: (2024)
Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific Adaptation
by: Wang, Fu-Yun, et al.
Published: (2024)
by: Wang, Fu-Yun, et al.
Published: (2024)
MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs
by: Chen, Huiyi, et al.
Published: (2025)
by: Chen, Huiyi, et al.
Published: (2025)
Recognize Any Regions
by: Yang, Haosen, et al.
Published: (2023)
by: Yang, Haosen, et al.
Published: (2023)
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
by: Sun, Xibo, et al.
Published: (2024)
by: Sun, Xibo, et al.
Published: (2024)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
by: Shukor, Mustafa, et al.
Published: (2024)
by: Shukor, Mustafa, et al.
Published: (2024)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
by: Yu, Mingyu, et al.
Published: (2026)
by: Yu, Mingyu, et al.
Published: (2026)
HunyuanVideo: A Systematic Framework For Large Video Generative Models
by: Kong, Weijie, et al.
Published: (2024)
by: Kong, Weijie, et al.
Published: (2024)
Similar Items
-
Refining Critical Thinking in LLM Code Generation: A Faulty Premise-based Evaluation Framework
by: Li, Jialin, et al.
Published: (2025) -
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
by: Li, Jinzhe, et al.
Published: (2025) -
Asymmetric Co-Training for Source-Free Few-Shot Domain Adaptation
by: Li, Gengxu, et al.
Published: (2025) -
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
by: Wang, Ziyue, et al.
Published: (2024) -
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
by: Peng, Tianfan, et al.
Published: (2025)