Measuring Epistemic Humility in Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tong, Bingkui, Xia, Jiaer, Shang, Sifeng, Zhou, Kaiyang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
von: Tong, Bingkui, et al.
Veröffentlicht: (2025)
von: Tong, Bingkui, et al.
Veröffentlicht: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
Streaming Video Instruction Tuning
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
von: Xia, Jiaer, et al.
Veröffentlicht: (2025)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
von: He, Haichen, et al.
Veröffentlicht: (2026)
von: He, Haichen, et al.
Veröffentlicht: (2026)
Fine-tuning Quantized Neural Networks with Zeroth-order Optimization
von: Shang, Sifeng, et al.
Veröffentlicht: (2025)
von: Shang, Sifeng, et al.
Veröffentlicht: (2025)
SHAN: Object-Level Privacy Detection via Inference on Scene Heterogeneous Graph
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2024)
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2024)
Contextual Object Detection with Multimodal Large Language Models
von: Zang, Yuhang, et al.
Veröffentlicht: (2023)
von: Zang, Yuhang, et al.
Veröffentlicht: (2023)
Beyond Visual Appearances: Privacy-sensitive Objects Identification via Hybrid Graph Reasoning
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2024)
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2024)
HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
von: Jin, Leyang, et al.
Veröffentlicht: (2026)
von: Jin, Leyang, et al.
Veröffentlicht: (2026)
Learning to Think Fast and Slow for Visual Language Models
von: Lin, Chenyu, et al.
Veröffentlicht: (2025)
von: Lin, Chenyu, et al.
Veröffentlicht: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
von: Wu, Junda, et al.
Veröffentlicht: (2024)
von: Wu, Junda, et al.
Veröffentlicht: (2024)
Attention Disturbance and Dual-Path Constraint Network for Occluded Person Re-identification
von: Xia, Jiaer, et al.
Veröffentlicht: (2023)
von: Xia, Jiaer, et al.
Veröffentlicht: (2023)
Hard Labels In! Rethinking the Role of Hard Labels in Mitigating Local Semantic Drift
von: Cui, Jiacheng, et al.
Veröffentlicht: (2025)
von: Cui, Jiacheng, et al.
Veröffentlicht: (2025)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
MMaDA: Multimodal Large Diffusion Language Models
von: Yang, Ling, et al.
Veröffentlicht: (2025)
von: Yang, Ling, et al.
Veröffentlicht: (2025)
Hallucination of Multimodal Large Language Models: A Survey
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
von: Bai, Zechen, et al.
Veröffentlicht: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
von: Wu, Jianzong, et al.
Veröffentlicht: (2024)
von: Wu, Jianzong, et al.
Veröffentlicht: (2024)
LLMGA: Multimodal Large Language Model based Generation Assistant
von: Xia, Bin, et al.
Veröffentlicht: (2023)
von: Xia, Bin, et al.
Veröffentlicht: (2023)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
von: Liu, Jingping, et al.
Veröffentlicht: (2025)
von: Liu, Jingping, et al.
Veröffentlicht: (2025)
GSVA: Generalized Segmentation via Multimodal Large Language Models
von: Xia, Zhuofan, et al.
Veröffentlicht: (2023)
von: Xia, Zhuofan, et al.
Veröffentlicht: (2023)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
von: Tong, Bo, et al.
Veröffentlicht: (2024)
von: Tong, Bo, et al.
Veröffentlicht: (2024)
M^3:Manipulation Mask Manufacturer for Arbitrary-Scale Super-Resolution Mask
von: Yang, Xinyu, et al.
Veröffentlicht: (2024)
von: Yang, Xinyu, et al.
Veröffentlicht: (2024)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
von: Zhou, Runjie, et al.
Veröffentlicht: (2026)
von: Zhou, Runjie, et al.
Veröffentlicht: (2026)
Semantic Alignment for Multimodal Large Language Models
von: Wu, Tao, et al.
Veröffentlicht: (2024)
von: Wu, Tao, et al.
Veröffentlicht: (2024)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
von: Luo, Katie, et al.
Veröffentlicht: (2025)
von: Luo, Katie, et al.
Veröffentlicht: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
von: Shao, Kele, et al.
Veröffentlicht: (2025)
von: Shao, Kele, et al.
Veröffentlicht: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
von: HyperAI Team, et al.
Veröffentlicht: (2025)
von: HyperAI Team, et al.
Veröffentlicht: (2025)
HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
von: Xu, Shilin, et al.
Veröffentlicht: (2024)
von: Xu, Shilin, et al.
Veröffentlicht: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
von: Lei, Lei, et al.
Veröffentlicht: (2025)
von: Lei, Lei, et al.
Veröffentlicht: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
von: Xuan, Weihao, et al.
Veröffentlicht: (2025)
von: Xuan, Weihao, et al.
Veröffentlicht: (2025)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2024)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
von: Ding, Meiwen, et al.
Veröffentlicht: (2026)
von: Ding, Meiwen, et al.
Veröffentlicht: (2026)
Investigating Traffic Accident Detection Using Multimodal Large Language Models
von: Skender, Ilhan, et al.
Veröffentlicht: (2025)
von: Skender, Ilhan, et al.
Veröffentlicht: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models for Multimodal Search
von: Barbany, Oriol, et al.
Veröffentlicht: (2024)
von: Barbany, Oriol, et al.
Veröffentlicht: (2024)
Multimodal Large Language Models as Image Classifiers
von: Kisel, Nikita, et al.
Veröffentlicht: (2026)
von: Kisel, Nikita, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
von: Tong, Bingkui, et al.
Veröffentlicht: (2025) -
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
von: Xia, Jiaer, et al.
Veröffentlicht: (2025) -
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
von: Xia, Jiaer, et al.
Veröffentlicht: (2025) -
Streaming Video Instruction Tuning
von: Xia, Jiaer, et al.
Veröffentlicht: (2025) -
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
von: He, Haichen, et al.
Veröffentlicht: (2026)