AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiping, Ma, Jianghong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving
par: Tian, Kefei, et autres
Publié: (2026)
par: Tian, Kefei, et autres
Publié: (2026)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
par: Kao, Shiu-hong, et autres
Publié: (2025)
par: Kao, Shiu-hong, et autres
Publié: (2025)
CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction
par: Kao, Shiu-hong, et autres
Publié: (2026)
par: Kao, Shiu-hong, et autres
Publié: (2026)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
par: Chen, Xinyan, et autres
Publié: (2025)
par: Chen, Xinyan, et autres
Publié: (2025)
X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning
par: Ng, Chee, et autres
Publié: (2025)
par: Ng, Chee, et autres
Publié: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
par: Liao, Jiaqi, et autres
Publié: (2025)
par: Liao, Jiaqi, et autres
Publié: (2025)
CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
par: Qi, Yu, et autres
Publié: (2025)
par: Qi, Yu, et autres
Publié: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
par: Lin, Weihuang, et autres
Publié: (2025)
par: Lin, Weihuang, et autres
Publié: (2025)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
par: Shao, Hao, et autres
Publié: (2024)
par: Shao, Hao, et autres
Publié: (2024)
X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning
par: Pulakurthi, Prasanna Reddy, et autres
Publié: (2025)
par: Pulakurthi, Prasanna Reddy, et autres
Publié: (2025)
CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning
par: Song, Jeonghyo, et autres
Publié: (2025)
par: Song, Jeonghyo, et autres
Publié: (2025)
CoT-Pose: Chain-of-Thought Reasoning for 3D Pose Generation from Abstract Prompts
par: Cha, Junuk, et autres
Publié: (2025)
par: Cha, Junuk, et autres
Publié: (2025)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
par: Lim, Byeonggeuk, et autres
Publié: (2026)
par: Lim, Byeonggeuk, et autres
Publié: (2026)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
par: Zhang, Shuyi, et autres
Publié: (2025)
par: Zhang, Shuyi, et autres
Publié: (2025)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
par: Pham, Tan-Hanh, et autres
Publié: (2025)
par: Pham, Tan-Hanh, et autres
Publié: (2025)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
par: Xu, Guowei, et autres
Publié: (2024)
par: Xu, Guowei, et autres
Publié: (2024)
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
par: Choi, Hojun, et autres
Publié: (2025)
par: Choi, Hojun, et autres
Publié: (2025)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization
par: Fang, Hao, et autres
Publié: (2026)
par: Fang, Hao, et autres
Publié: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
par: Wang, Zhaohui, et autres
Publié: (2025)
par: Wang, Zhaohui, et autres
Publié: (2025)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
par: Zhang, Honglu, et autres
Publié: (2025)
par: Zhang, Honglu, et autres
Publié: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
par: Zhang, Jialiang, et autres
Publié: (2026)
par: Zhang, Jialiang, et autres
Publié: (2026)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
par: Zhong, Zhide, et autres
Publié: (2026)
par: Zhong, Zhide, et autres
Publié: (2026)
Pathology-CoT: Learning Visual Chain-of-Thought Agent from Expert Whole Slide Image Diagnosis Behavior
par: Wang, Sheng, et autres
Publié: (2025)
par: Wang, Sheng, et autres
Publié: (2025)
CoT-Drive: Efficient Motion Forecasting for Autonomous Driving with LLMs and Chain-of-Thought Prompting
par: Liao, Haicheng, et autres
Publié: (2025)
par: Liao, Haicheng, et autres
Publié: (2025)
Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
par: Zou, Zhentao, et autres
Publié: (2025)
par: Zou, Zhentao, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
par: Wang, Yaoting, et autres
Publié: (2025)
par: Wang, Yaoting, et autres
Publié: (2025)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
par: Man, Yunze, et autres
Publié: (2025)
par: Man, Yunze, et autres
Publié: (2025)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
par: Wang, Lihong, et autres
Publié: (2025)
par: Wang, Lihong, et autres
Publié: (2025)
Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT
par: Asfour, Alaa, et autres
Publié: (2026)
par: Asfour, Alaa, et autres
Publié: (2026)
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
par: Qiu, Longtian, et autres
Publié: (2025)
par: Qiu, Longtian, et autres
Publié: (2025)
Documents similaires
-
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025) -
C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving
par: Tian, Kefei, et autres
Publié: (2026) -
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
par: Kao, Shiu-hong, et autres
Publié: (2025) -
CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction
par: Kao, Shiu-hong, et autres
Publié: (2026) -
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
par: Chen, Xinyan, et autres
Publié: (2025)