Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yangyi, Sikka, Karan, Cogswell, Michael, Ji, Heng, Divakaran, Ajay |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
A Video is Worth 10,000 Words: Training and Benchmarking with Diverse Captions for Better Long Video Retrieval
par: Gwilliam, Matthew, et autres
Publié: (2023)
par: Gwilliam, Matthew, et autres
Publié: (2023)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
par: Chen, Yangyi, et autres
Publié: (2024)
par: Chen, Yangyi, et autres
Publié: (2024)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
par: Chen, Yangyi, et autres
Publié: (2025)
par: Chen, Yangyi, et autres
Publié: (2025)
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
par: Gong, Yunye, et autres
Publié: (2023)
par: Gong, Yunye, et autres
Publié: (2023)
Pelican: Correcting Hallucination in Vision-LLMs via Claim Decomposition and Program of Thought Verification
par: Sahu, Pritish, et autres
Publié: (2024)
par: Sahu, Pritish, et autres
Publié: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
par: Xu, Qinwu, et autres
Publié: (2026)
par: Xu, Qinwu, et autres
Publié: (2026)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
par: Sun, Linzhuang, et autres
Publié: (2025)
par: Sun, Linzhuang, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
Probing Conceptual Understanding of Large Visual-Language Models
par: Schiappa, Madeline, et autres
Publié: (2023)
par: Schiappa, Madeline, et autres
Publié: (2023)
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025)
par: Zhong, Yiwu, et autres
Publié: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
par: Qian, Kangan, et autres
Publié: (2025)
par: Qian, Kangan, et autres
Publié: (2025)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
par: Dai, Xuanlang, et autres
Publié: (2026)
par: Dai, Xuanlang, et autres
Publié: (2026)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
par: Chen, Yanjun, et autres
Publié: (2025)
par: Chen, Yanjun, et autres
Publié: (2025)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
par: Kim, Jeonghwan, et autres
Publié: (2024)
par: Kim, Jeonghwan, et autres
Publié: (2024)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
par: Chen, Qiguang, et autres
Publié: (2025)
par: Chen, Qiguang, et autres
Publié: (2025)
Punching Bag vs. Punching Person: Motion Transferability in Videos
par: Abdullah, Raiyaan, et autres
Publié: (2025)
par: Abdullah, Raiyaan, et autres
Publié: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
par: Cheng, Kanzhi, et autres
Publié: (2024)
par: Cheng, Kanzhi, et autres
Publié: (2024)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
par: Lv, Weijiang, et autres
Publié: (2026)
par: Lv, Weijiang, et autres
Publié: (2026)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
par: Villegas, Danae Sánchez, et autres
Publié: (2025)
par: Villegas, Danae Sánchez, et autres
Publié: (2025)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
par: Gao, Timin, et autres
Publié: (2024)
par: Gao, Timin, et autres
Publié: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
par: Li, Chengzu, et autres
Publié: (2024)
par: Li, Chengzu, et autres
Publié: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
par: Chen, Boyuan, et autres
Publié: (2024)
par: Chen, Boyuan, et autres
Publié: (2024)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)
par: Peng, Yi, et autres
Publié: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
par: Hu, Yushi, et autres
Publié: (2024)
par: Hu, Yushi, et autres
Publié: (2024)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)
par: Cheng, Zihui, et autres
Publié: (2025)
Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models
par: Siddique, Md. Abu Bakor, et autres
Publié: (2026)
par: Siddique, Md. Abu Bakor, et autres
Publié: (2026)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
par: Li, Xue, et autres
Publié: (2025)
par: Li, Xue, et autres
Publié: (2025)
Documents similaires
-
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
par: Chen, Yangyi, et autres
Publié: (2023) -
A Video is Worth 10,000 Words: Training and Benchmarking with Diverse Captions for Better Long Video Retrieval
par: Gwilliam, Matthew, et autres
Publié: (2023) -
SOLO: A Single Transformer for Scalable Vision-Language Modeling
par: Chen, Yangyi, et autres
Publié: (2024) -
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
par: Chen, Yangyi, et autres
Publié: (2025) -
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
par: Gong, Yunye, et autres
Publié: (2023)