SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lv, Weijiang, Feng, Yaoxuan, Xia, Xiaobo, Wang, Jiayu, Jing, Yan, Chen, Wenchao, Chen, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoFaith: A Spatio-Temporal Dual View of Faithful Chain-of-Thought
par: Lv, Weijiang, et autres
Publié: (2026)
par: Lv, Weijiang, et autres
Publié: (2026)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026)
par: Tian, Changyuan, et autres
Publié: (2026)
On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models
par: Tanneru, Sree Harsha, et autres
Publié: (2024)
par: Tanneru, Sree Harsha, et autres
Publié: (2024)
Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning
par: Jia, Jinghan, et autres
Publié: (2026)
par: Jia, Jinghan, et autres
Publié: (2026)
Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoning
par: Paul, Debjit, et autres
Publié: (2024)
par: Paul, Debjit, et autres
Publié: (2024)
Dual Prototype-Conditioned Diffusion Model for Scalable Multi-Class Unsupervised Anomaly Detection in Large Category Spaces
par: Feng, Yaoxuan, et autres
Publié: (2026)
par: Feng, Yaoxuan, et autres
Publié: (2026)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
par: Gao, Silin, et autres
Publié: (2025)
par: Gao, Silin, et autres
Publié: (2025)
Faithful Logical Reasoning via Symbolic Chain-of-Thought
par: Xu, Jundong, et autres
Publié: (2024)
par: Xu, Jundong, et autres
Publié: (2024)
Mechanistic Evidence for Faithfulness Decay in Chain-of-Thought Reasoning
par: Ye, Donald, et autres
Publié: (2026)
par: Ye, Donald, et autres
Publié: (2026)
Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps
par: Tutek, Martin, et autres
Publié: (2025)
par: Tutek, Martin, et autres
Publié: (2025)
Counterfactual Simulation Training for Chain-of-Thought Faithfulness
par: Hase, Peter, et autres
Publié: (2026)
par: Hase, Peter, et autres
Publié: (2026)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
par: Moll, Johannes, et autres
Publié: (2025)
par: Moll, Johannes, et autres
Publié: (2025)
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models
par: Pan, Zhenyu, et autres
Publié: (2024)
par: Pan, Zhenyu, et autres
Publié: (2024)
Towards Better Chain-of-Thought: A Reflection on Effectiveness and Faithfulness
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs
par: Mohammadi, Hadi, et autres
Publié: (2025)
par: Mohammadi, Hadi, et autres
Publié: (2025)
C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning
par: Mittal, Avni, et autres
Publié: (2026)
par: Mittal, Avni, et autres
Publié: (2026)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
par: Qiu, Haoyi, et autres
Publié: (2024)
par: Qiu, Haoyi, et autres
Publié: (2024)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
par: Arcuschin, Iván, et autres
Publié: (2025)
par: Arcuschin, Iván, et autres
Publié: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
par: Gao, Timin, et autres
Publié: (2024)
par: Gao, Timin, et autres
Publié: (2024)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)
par: Cheng, Zihui, et autres
Publié: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages
par: Zhao, Raoyuan, et autres
Publié: (2025)
par: Zhao, Raoyuan, et autres
Publié: (2025)
Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity
par: Meek, Austin, et autres
Publié: (2025)
par: Meek, Austin, et autres
Publié: (2025)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
par: Qi, Yukun, et autres
Publié: (2025)
par: Qi, Yukun, et autres
Publié: (2025)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
par: Chen, Yanjun, et autres
Publié: (2025)
par: Chen, Yanjun, et autres
Publié: (2025)
FaithLM: Towards Faithful Explanations for Large Language Models
par: Chuang, Yu-Neng, et autres
Publié: (2024)
par: Chuang, Yu-Neng, et autres
Publié: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients
par: Kazama, Kentaro, et autres
Publié: (2026)
par: Kazama, Kentaro, et autres
Publié: (2026)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
par: Chen, Liang, et autres
Publié: (2024)
par: Chen, Liang, et autres
Publié: (2024)
Dancing in Chains: Reconciling Instruction Following and Faithfulness in Language Models
par: Wu, Zhengxuan, et autres
Publié: (2024)
par: Wu, Zhengxuan, et autres
Publié: (2024)
Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
par: Zaman, Kerem, et autres
Publié: (2025)
par: Zaman, Kerem, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?
par: Young, Richard J.
Publié: (2026)
par: Young, Richard J.
Publié: (2026)
Mitigating Large Language Model Hallucination with Faithful Finetuning
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
Improving Contextual Faithfulness of Large Language Models via Retrieval Heads-Induced Optimization
par: Huang, Lei, et autres
Publié: (2025)
par: Huang, Lei, et autres
Publié: (2025)
A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models
par: Balasubramanian, Sriram, et autres
Publié: (2025)
par: Balasubramanian, Sriram, et autres
Publié: (2025)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
par: Tian, Baoliang, et autres
Publié: (2025)
par: Tian, Baoliang, et autres
Publié: (2025)
ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models
par: Wang, Fen, et autres
Publié: (2026)
par: Wang, Fen, et autres
Publié: (2026)
Documents similaires
-
GeoFaith: A Spatio-Temporal Dual View of Faithful Chain-of-Thought
par: Lv, Weijiang, et autres
Publié: (2026) -
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
par: Tian, Changyuan, et autres
Publié: (2026) -
On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models
par: Tanneru, Sree Harsha, et autres
Publié: (2024) -
Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning
par: Jia, Jinghan, et autres
Publié: (2026) -
Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoning
par: Paul, Debjit, et autres
Publié: (2024)