Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jia, Boyu, Zhang, Junzhe, Zhang, Huixuan, Wan, Xiaojun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025)
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
von: Zhang, Junzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Junzhe, et al.
Veröffentlicht: (2025)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
von: Zhang, Huixuan, et al.
Veröffentlicht: (2023)
von: Zhang, Huixuan, et al.
Veröffentlicht: (2023)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
von: Zhang, Junzhe, et al.
Veröffentlicht: (2025)
von: Zhang, Junzhe, et al.
Veröffentlicht: (2025)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2024)
von: Zhang, Huixuan, et al.
Veröffentlicht: (2024)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025)
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025)
ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
von: Zhang, Zhenliang, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenliang, et al.
Veröffentlicht: (2025)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2024)
von: Zhang, Huixuan, et al.
Veröffentlicht: (2024)
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
von: Zhang, Xu, et al.
Veröffentlicht: (2025)
von: Zhang, Xu, et al.
Veröffentlicht: (2025)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
von: Zhang, Junzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Junzhe, et al.
Veröffentlicht: (2024)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
von: Zhang, Junzhe, et al.
Veröffentlicht: (2024)
von: Zhang, Junzhe, et al.
Veröffentlicht: (2024)
Cross-Modal Consistency in Multimodal Large Language Models
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
Multimodal Reasoning with Multimodal Knowledge Graph
von: Lee, Junlin, et al.
Veröffentlicht: (2024)
von: Lee, Junlin, et al.
Veröffentlicht: (2024)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
DCR-Consistency: Divide-Conquer-Reasoning for Consistency Evaluation and Improvement of Large Language Models
von: Cui, Wendi, et al.
Veröffentlicht: (2024)
von: Cui, Wendi, et al.
Veröffentlicht: (2024)
Exploring the Capabilities of Large Multimodal Models on Dense Text
von: Zhang, Shuo, et al.
Veröffentlicht: (2024)
von: Zhang, Shuo, et al.
Veröffentlicht: (2024)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
von: Saxena, Yash, et al.
Veröffentlicht: (2024)
von: Saxena, Yash, et al.
Veröffentlicht: (2024)
M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models
von: Kwon, Yejin, et al.
Veröffentlicht: (2025)
von: Kwon, Yejin, et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
ChatSR: Multimodal Large Language Models for Scientific Formula Discovery
von: Li, Yanjie, et al.
Veröffentlicht: (2024)
von: Li, Yanjie, et al.
Veröffentlicht: (2024)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
von: Gu, Leijiang, et al.
Veröffentlicht: (2026)
von: Gu, Leijiang, et al.
Veröffentlicht: (2026)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
GraphArena: Evaluating and Exploring Large Language Models on Graph Computation
von: Tang, Jianheng, et al.
Veröffentlicht: (2024)
von: Tang, Jianheng, et al.
Veröffentlicht: (2024)
Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency
von: Huang, Baizhou, et al.
Veröffentlicht: (2023)
von: Huang, Baizhou, et al.
Veröffentlicht: (2023)
Multimodal Chain-of-Thought Reasoning in Language Models
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
Brainstorming Brings Power to Large Language Models of Knowledge Reasoning
von: Qin, Zining, et al.
Veröffentlicht: (2024)
von: Qin, Zining, et al.
Veröffentlicht: (2024)
Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning
von: Zhao, Jun, et al.
Veröffentlicht: (2024)
von: Zhao, Jun, et al.
Veröffentlicht: (2024)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
von: Liu, Daixian, et al.
Veröffentlicht: (2026)
von: Liu, Daixian, et al.
Veröffentlicht: (2026)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
von: Zhu, Zhihao, et al.
Veröffentlicht: (2026)
von: Zhu, Zhihao, et al.
Veröffentlicht: (2026)
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
von: Yan, Yibo, et al.
Veröffentlicht: (2025)
von: Yan, Yibo, et al.
Veröffentlicht: (2025)
Disentangling Reasoning and Knowledge in Medical Large Language Models
von: Thapa, Rahul, et al.
Veröffentlicht: (2025)
von: Thapa, Rahul, et al.
Veröffentlicht: (2025)
Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench
von: Liu, Zheyuan, et al.
Veröffentlicht: (2024)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2024)
RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation
von: Wang, Haofeng, et al.
Veröffentlicht: (2025)
von: Wang, Haofeng, et al.
Veröffentlicht: (2025)
SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
von: Torres-Fonseca, Josue, et al.
Veröffentlicht: (2026)
von: Torres-Fonseca, Josue, et al.
Veröffentlicht: (2026)
Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models
von: Zhang, Han, et al.
Veröffentlicht: (2026)
von: Zhang, Han, et al.
Veröffentlicht: (2026)
Evaluating and Enhancing Large Language Models for Conversational Reasoning on Knowledge Graphs
von: Huang, Yuxuan
Veröffentlicht: (2023)
von: Huang, Yuxuan
Veröffentlicht: (2023)
On Fairness of Unified Multimodal Large Language Model for Image Generation
von: Liu, Ming, et al.
Veröffentlicht: (2025)
von: Liu, Ming, et al.
Veröffentlicht: (2025)
Exploring Large Language Models for Multimodal Sentiment Analysis: Challenges, Benchmarks, and Future Directions
von: Song, Shezheng
Veröffentlicht: (2024)
von: Song, Shezheng
Veröffentlicht: (2024)
From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice
von: Niu, Qian, et al.
Veröffentlicht: (2024)
von: Niu, Qian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025) -
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
von: Zhang, Junzhe, et al.
Veröffentlicht: (2025) -
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
von: Zhang, Huixuan, et al.
Veröffentlicht: (2023) -
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
von: Zhang, Junzhe, et al.
Veröffentlicht: (2025) -
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2024)