Measuring Epistemic Humility in Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tong, Bingkui, Xia, Jiaer, Shang, Sifeng, Zhou, Kaiyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
par: Tong, Bingkui, et autres
Publié: (2025)
par: Tong, Bingkui, et autres
Publié: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
Streaming Video Instruction Tuning
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
par: He, Haichen, et autres
Publié: (2026)
par: He, Haichen, et autres
Publié: (2026)
Fine-tuning Quantized Neural Networks with Zeroth-order Optimization
par: Shang, Sifeng, et autres
Publié: (2025)
par: Shang, Sifeng, et autres
Publié: (2025)
SHAN: Object-Level Privacy Detection via Inference on Scene Heterogeneous Graph
par: Jiang, Zhuohang, et autres
Publié: (2024)
par: Jiang, Zhuohang, et autres
Publié: (2024)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
Beyond Visual Appearances: Privacy-sensitive Objects Identification via Hybrid Graph Reasoning
par: Jiang, Zhuohang, et autres
Publié: (2024)
par: Jiang, Zhuohang, et autres
Publié: (2024)
HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
par: Jin, Leyang, et autres
Publié: (2026)
par: Jin, Leyang, et autres
Publié: (2026)
Learning to Think Fast and Slow for Visual Language Models
par: Lin, Chenyu, et autres
Publié: (2025)
par: Lin, Chenyu, et autres
Publié: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Attention Disturbance and Dual-Path Constraint Network for Occluded Person Re-identification
par: Xia, Jiaer, et autres
Publié: (2023)
par: Xia, Jiaer, et autres
Publié: (2023)
Hard Labels In! Rethinking the Role of Hard Labels in Mitigating Local Semantic Drift
par: Cui, Jiacheng, et autres
Publié: (2025)
par: Cui, Jiacheng, et autres
Publié: (2025)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
par: Huang, Xiaoshuang, et autres
Publié: (2024)
par: Huang, Xiaoshuang, et autres
Publié: (2024)
MMaDA: Multimodal Large Diffusion Language Models
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
Hallucination of Multimodal Large Language Models: A Survey
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
LLMGA: Multimodal Large Language Model based Generation Assistant
par: Xia, Bin, et autres
Publié: (2023)
par: Xia, Bin, et autres
Publié: (2023)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
par: Liu, Jingping, et autres
Publié: (2025)
par: Liu, Jingping, et autres
Publié: (2025)
GSVA: Generalized Segmentation via Multimodal Large Language Models
par: Xia, Zhuofan, et autres
Publié: (2023)
par: Xia, Zhuofan, et autres
Publié: (2023)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
par: Tong, Bo, et autres
Publié: (2024)
par: Tong, Bo, et autres
Publié: (2024)
M^3:Manipulation Mask Manufacturer for Arbitrary-Scale Super-Resolution Mask
par: Yang, Xinyu, et autres
Publié: (2024)
par: Yang, Xinyu, et autres
Publié: (2024)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
par: Zhou, Runjie, et autres
Publié: (2026)
par: Zhou, Runjie, et autres
Publié: (2026)
Semantic Alignment for Multimodal Large Language Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
par: Luo, Katie, et autres
Publié: (2025)
par: Luo, Katie, et autres
Publié: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
par: HyperAI Team, et autres
Publié: (2025)
par: HyperAI Team, et autres
Publié: (2025)
HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model
par: Zhang, Zhenhao, et autres
Publié: (2025)
par: Zhang, Zhenhao, et autres
Publié: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
par: Lei, Lei, et autres
Publié: (2025)
par: Lei, Lei, et autres
Publié: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
par: Xuan, Weihao, et autres
Publié: (2025)
par: Xuan, Weihao, et autres
Publié: (2025)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
par: Ding, Meiwen, et autres
Publié: (2026)
par: Ding, Meiwen, et autres
Publié: (2026)
Investigating Traffic Accident Detection Using Multimodal Large Language Models
par: Skender, Ilhan, et autres
Publié: (2025)
par: Skender, Ilhan, et autres
Publié: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
par: Zhao, Shiyu, et autres
Publié: (2024)
par: Zhao, Shiyu, et autres
Publié: (2024)
Leveraging Large Language Models for Multimodal Search
par: Barbany, Oriol, et autres
Publié: (2024)
par: Barbany, Oriol, et autres
Publié: (2024)
Multimodal Large Language Models as Image Classifiers
par: Kisel, Nikita, et autres
Publié: (2026)
par: Kisel, Nikita, et autres
Publié: (2026)
Documents similaires
-
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
par: Tong, Bingkui, et autres
Publié: (2025) -
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
par: Xia, Jiaer, et autres
Publié: (2025) -
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
par: Xia, Jiaer, et autres
Publié: (2025) -
Streaming Video Instruction Tuning
par: Xia, Jiaer, et autres
Publié: (2025) -
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
par: He, Haichen, et autres
Publié: (2026)