Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Zhihao, Liang, Jiafeng, Jiang, Shixin, Fu, Jinlan, Liu, Ming, Sun, Guanglu, Ng, See-Kiong, Qin, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal Inconsistency
di: Liang, Jiafeng, et al.
Pubblicazione: (2025)
di: Liang, Jiafeng, et al.
Pubblicazione: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs
di: Liang, Jiafeng, et al.
Pubblicazione: (2026)
di: Liang, Jiafeng, et al.
Pubblicazione: (2026)
AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents
di: Liang, Jiafeng, et al.
Pubblicazione: (2025)
di: Liang, Jiafeng, et al.
Pubblicazione: (2025)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
CET2: Modelling Topic Transitions for Coherent and Engaging Knowledge-Grounded Conversations
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
di: Fu, Jinlan, et al.
Pubblicazione: (2024)
di: Fu, Jinlan, et al.
Pubblicazione: (2024)
Chain of Thought Explanation for Dialogue State Tracking
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
di: Bin, Yi, et al.
Pubblicazione: (2024)
di: Bin, Yi, et al.
Pubblicazione: (2024)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
di: Shi, Wenhao, et al.
Pubblicazione: (2024)
di: Shi, Wenhao, et al.
Pubblicazione: (2024)
Multimodal Mathematical Reasoning with Diverse Solving Perspective
di: Shi, Wenhao, et al.
Pubblicazione: (2025)
di: Shi, Wenhao, et al.
Pubblicazione: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
Calibrated Multimodal Representation Learning with Missing Modalities
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Confidence Elicitation: A New Attack Vector for Large Language Models
di: Formento, Brian, et al.
Pubblicazione: (2025)
di: Formento, Brian, et al.
Pubblicazione: (2025)
Principled Multimodal Representation Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
GUIDE: A Guideline-Guided Dataset for Instructional Video Comprehension
di: Liang, Jiafeng, et al.
Pubblicazione: (2024)
di: Liang, Jiafeng, et al.
Pubblicazione: (2024)
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
di: Liu, Renyang, et al.
Pubblicazione: (2025)
di: Liu, Renyang, et al.
Pubblicazione: (2025)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
di: Liu, Renyang, et al.
Pubblicazione: (2024)
di: Liu, Renyang, et al.
Pubblicazione: (2024)
Towards Modality Generalization: A Benchmark and Prospective Analysis
di: Liu, Xiaohao, et al.
Pubblicazione: (2024)
di: Liu, Xiaohao, et al.
Pubblicazione: (2024)
Cross-Modal Consistency in Multimodal Large Language Models
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
di: Zhao, Yong, et al.
Pubblicazione: (2025)
di: Zhao, Yong, et al.
Pubblicazione: (2025)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
di: Fan, Yingqi, et al.
Pubblicazione: (2025)
di: Fan, Yingqi, et al.
Pubblicazione: (2025)
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
di: Li, Pengfeng, et al.
Pubblicazione: (2026)
di: Li, Pengfeng, et al.
Pubblicazione: (2026)
Towards Proactive Information Probing: Customer Service Chatbots Harvesting Value from Conversation
di: Huang, Chen, et al.
Pubblicazione: (2026)
di: Huang, Chen, et al.
Pubblicazione: (2026)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
di: Du, Mingzhe, et al.
Pubblicazione: (2024)
di: Du, Mingzhe, et al.
Pubblicazione: (2024)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
di: Deng, Yang, et al.
Pubblicazione: (2023)
di: Deng, Yang, et al.
Pubblicazione: (2023)
From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
Spatio-Temporal Foundation Models: Vision, Challenges, and Opportunities
di: Goodge, Adam, et al.
Pubblicazione: (2025)
di: Goodge, Adam, et al.
Pubblicazione: (2025)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
di: Deng, Yang, et al.
Pubblicazione: (2024)
di: Deng, Yang, et al.
Pubblicazione: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
Dipper: Diversity in Prompts for Producing Large Language Model Ensembles in Reasoning tasks
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
SiMO: Single-Modality-Operable Multimodal Collaborative Perception
di: Wen, Jiageng, et al.
Pubblicazione: (2026)
di: Wen, Jiageng, et al.
Pubblicazione: (2026)
Data-Free Federated Class Incremental Learning with Diffusion-Based Generative Memory
di: Wang, Naibo, et al.
Pubblicazione: (2024)
di: Wang, Naibo, et al.
Pubblicazione: (2024)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
di: Guo, Xiangyu, et al.
Pubblicazione: (2025)
di: Guo, Xiangyu, et al.
Pubblicazione: (2025)
PHAnToM: Persona-based Prompting Has An Effect on Theory-of-Mind Reasoning in Large Language Models
di: Tan, Fiona Anting, et al.
Pubblicazione: (2024)
di: Tan, Fiona Anting, et al.
Pubblicazione: (2024)
MASim: Multilingual Agent-Based Simulation for Social Science
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal Inconsistency
di: Liang, Jiafeng, et al.
Pubblicazione: (2025) -
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026) -
Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs
di: Liang, Jiafeng, et al.
Pubblicazione: (2026) -
AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents
di: Liang, Jiafeng, et al.
Pubblicazione: (2025) -
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
di: Fu, Jinlan, et al.
Pubblicazione: (2025)