Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sinha, Sanchit, Xiong, Guangzhi, Liu, Bohan, He, Zhenghao, Zhang, Aidong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
Retrieving Counterfactuals Improves Visual In-Context Learning
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
GCAV: A Global Concept Activation Vector Framework for Cross-Layer Consistency in Interpretability
par: He, Zhenghao, et autres
Publié: (2025)
par: He, Zhenghao, et autres
Publié: (2025)
ASCENT-ViT: Attention-based Scale-aware Concept Learning Framework for Enhanced Alignment in Vision Transformers
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
par: He, Zhenghao, et autres
Publié: (2026)
par: He, Zhenghao, et autres
Publié: (2026)
CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models
par: He, Zhenghao, et autres
Publié: (2026)
par: He, Zhenghao, et autres
Publié: (2026)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders
par: Xiong, Guangzhi, et autres
Publié: (2025)
par: Xiong, Guangzhi, et autres
Publié: (2025)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
par: Zhang, Honglu, et autres
Publié: (2025)
par: Zhang, Honglu, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
par: Wang, Yaoting, et autres
Publié: (2025)
par: Wang, Yaoting, et autres
Publié: (2025)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
par: Pham, Tan-Hanh, et autres
Publié: (2025)
par: Pham, Tan-Hanh, et autres
Publié: (2025)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
par: Xu, Qinwu, et autres
Publié: (2026)
par: Xu, Qinwu, et autres
Publié: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
par: Zhang, Jialiang, et autres
Publié: (2026)
par: Zhang, Jialiang, et autres
Publié: (2026)
Structural Causality-based Generalizable Concept Discovery Models
par: Sinha, Sanchit, et autres
Publié: (2024)
par: Sinha, Sanchit, et autres
Publié: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
par: Li, Sijing, et autres
Publié: (2026)
par: Li, Sijing, et autres
Publié: (2026)
Neural Additive Experts: Context-Gated Experts for Controllable Model Additivity
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
ProtoNAM: Prototypical Neural Additive Models for Interpretable Deep Tabular Learning
par: Xiong, Guangzhi, et autres
Publié: (2024)
par: Xiong, Guangzhi, et autres
Publié: (2024)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
par: Zhou, Nan, et autres
Publié: (2026)
par: Zhou, Nan, et autres
Publié: (2026)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
SAGE: Spuriousness-Aware Guided Prompt Exploration for Mitigating Multimodal Bias
par: Ye, Wenqian, et autres
Publié: (2025)
par: Ye, Wenqian, et autres
Publié: (2025)
VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models
par: Sima, Bingrui, et autres
Publié: (2025)
par: Sima, Bingrui, et autres
Publié: (2025)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
par: Li, Xiping, et autres
Publié: (2025)
par: Li, Xiping, et autres
Publié: (2025)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
par: Man, Yunze, et autres
Publié: (2025)
par: Man, Yunze, et autres
Publié: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024)
par: Dong, Yuhao, et autres
Publié: (2024)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
par: Lv, Weijiang, et autres
Publié: (2026)
par: Lv, Weijiang, et autres
Publié: (2026)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026)
par: Ma, Ji, et autres
Publié: (2026)
CoLiDR: Concept Learning using Aggregated Disentangled Representations
par: Sinha, Sanchit, et autres
Publié: (2024)
par: Sinha, Sanchit, et autres
Publié: (2024)
A Self-explaining Neural Architecture for Generalizable Concept Learning
par: Sinha, Sanchit, et autres
Publié: (2024)
par: Sinha, Sanchit, et autres
Publié: (2024)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
par: Gu, Jiawei, et autres
Publié: (2025)
par: Gu, Jiawei, et autres
Publié: (2025)
Documents similaires
-
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025) -
COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025) -
Retrieving Counterfactuals Improves Visual In-Context Learning
par: Xiong, Guangzhi, et autres
Publié: (2026) -
GCAV: A Global Concept Activation Vector Framework for Cross-Layer Consistency in Interpretability
par: He, Zhenghao, et autres
Publié: (2025) -
ASCENT-ViT: Attention-based Scale-aware Concept Learning Framework for Enhanced Alignment in Vision Transformers
par: Sinha, Sanchit, et autres
Publié: (2025)