Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lu, Wenting, Zhu, Didi, Shen, Tao, Zhu, Donglin, Ye, Ayong, Wu, Chao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
von: Lu, Yi, et al.
Veröffentlicht: (2025)
von: Lu, Yi, et al.
Veröffentlicht: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
von: Zhao, Kesen, et al.
Veröffentlicht: (2026)
von: Zhao, Kesen, et al.
Veröffentlicht: (2026)
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
von: Wang, Tianyue, et al.
Veröffentlicht: (2026)
von: Wang, Tianyue, et al.
Veröffentlicht: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
von: Zhao, Kesen, et al.
Veröffentlicht: (2025)
von: Zhao, Kesen, et al.
Veröffentlicht: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
von: Zhou, Jiaxu, et al.
Veröffentlicht: (2026)
von: Zhou, Jiaxu, et al.
Veröffentlicht: (2026)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
von: Liu, Xu, et al.
Veröffentlicht: (2026)
von: Liu, Xu, et al.
Veröffentlicht: (2026)
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
von: Wu, Zhiheng, et al.
Veröffentlicht: (2026)
von: Wu, Zhiheng, et al.
Veröffentlicht: (2026)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
von: Gu, Jiawei, et al.
Veröffentlicht: (2025)
von: Gu, Jiawei, et al.
Veröffentlicht: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models
von: Peng, Ruiying, et al.
Veröffentlicht: (2026)
von: Peng, Ruiying, et al.
Veröffentlicht: (2026)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
von: Wu, Linquan, et al.
Veröffentlicht: (2026)
von: Wu, Linquan, et al.
Veröffentlicht: (2026)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
von: Acuna, David, et al.
Veröffentlicht: (2025)
von: Acuna, David, et al.
Veröffentlicht: (2025)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
von: Deng, Linger, et al.
Veröffentlicht: (2024)
von: Deng, Linger, et al.
Veröffentlicht: (2024)
Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts
von: Kao, Shiu-hong, et al.
Veröffentlicht: (2025)
von: Kao, Shiu-hong, et al.
Veröffentlicht: (2025)
ArgusCogito: Chain-of-Thought for Cross-Modal Synergy and Omnidirectional Reasoning in Camouflaged Object Segmentation
von: Tan, Jianwen, et al.
Veröffentlicht: (2025)
von: Tan, Jianwen, et al.
Veröffentlicht: (2025)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
von: Kumar, Somnath, et al.
Veröffentlicht: (2024)
von: Kumar, Somnath, et al.
Veröffentlicht: (2024)
Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
von: Xu, Mengling, et al.
Veröffentlicht: (2025)
von: Xu, Mengling, et al.
Veröffentlicht: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
von: Shi, Weikang, et al.
Veröffentlicht: (2025)
von: Shi, Weikang, et al.
Veröffentlicht: (2025)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
von: Wu, Jiahe, et al.
Veröffentlicht: (2026)
von: Wu, Jiahe, et al.
Veröffentlicht: (2026)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
von: Huo, Yu, et al.
Veröffentlicht: (2026)
von: Huo, Yu, et al.
Veröffentlicht: (2026)
ZeroFlow: Overcoming Catastrophic Forgetting is Easier than You Think
von: Feng, Tao, et al.
Veröffentlicht: (2025)
von: Feng, Tao, et al.
Veröffentlicht: (2025)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
von: Ma, Qihang, et al.
Veröffentlicht: (2025)
von: Ma, Qihang, et al.
Veröffentlicht: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
von: Qin, Yiming, et al.
Veröffentlicht: (2025)
von: Qin, Yiming, et al.
Veröffentlicht: (2025)
Generative Visual Chain-of-Thought for Image Editing
von: Yin, Zijin, et al.
Veröffentlicht: (2026)
von: Yin, Zijin, et al.
Veröffentlicht: (2026)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
von: Huang, Chao, et al.
Veröffentlicht: (2025)
von: Huang, Chao, et al.
Veröffentlicht: (2025)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
von: Wang, Song, et al.
Veröffentlicht: (2025)
von: Wang, Song, et al.
Veröffentlicht: (2025)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
von: Li, Lingxiao, et al.
Veröffentlicht: (2025)
von: Li, Lingxiao, et al.
Veröffentlicht: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
von: Shanker, Shambhavi, et al.
Veröffentlicht: (2025)
von: Shanker, Shambhavi, et al.
Veröffentlicht: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
von: Chen, Xinyan, et al.
Veröffentlicht: (2025)
von: Chen, Xinyan, et al.
Veröffentlicht: (2025)
Enhancing Video Memorability Prediction with Text-Motion Cross-modal Contrastive Loss and Its Application in Video Summarization
von: Zhu, Zhiyi, et al.
Veröffentlicht: (2025)
von: Zhu, Zhiyi, et al.
Veröffentlicht: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
von: Qian, Kangan, et al.
Veröffentlicht: (2025)
von: Qian, Kangan, et al.
Veröffentlicht: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
von: Wen, Junwei, et al.
Veröffentlicht: (2026)
von: Wen, Junwei, et al.
Veröffentlicht: (2026)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
von: Wang, Yaoting, et al.
Veröffentlicht: (2025)
von: Wang, Yaoting, et al.
Veröffentlicht: (2025)
MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
von: Ge, Xuri, et al.
Veröffentlicht: (2026)
von: Ge, Xuri, et al.
Veröffentlicht: (2026)
DiverGen: Improving Instance Segmentation by Learning Wider Data Distribution with More Diverse Generative Data
von: Fan, Chengxiang, et al.
Veröffentlicht: (2024)
von: Fan, Chengxiang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
von: Lu, Yi, et al.
Veröffentlicht: (2025) -
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
von: Zhao, Kesen, et al.
Veröffentlicht: (2026) -
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
von: Wang, Tianyue, et al.
Veröffentlicht: (2026) -
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
von: Zhao, Kesen, et al.
Veröffentlicht: (2025) -
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)