Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Guangfu, Lu, Xiaoqian, Feng, Yue, Sun, Mingming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
di: Acuna, David, et al.
Pubblicazione: (2025)
di: Acuna, David, et al.
Pubblicazione: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
di: Qin, Yiming, et al.
Pubblicazione: (2025)
di: Qin, Yiming, et al.
Pubblicazione: (2025)
Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
di: Lu, Wenting, et al.
Pubblicazione: (2026)
di: Lu, Wenting, et al.
Pubblicazione: (2026)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
di: Yi, Shixin, et al.
Pubblicazione: (2025)
di: Yi, Shixin, et al.
Pubblicazione: (2025)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
di: Zhang, Qizhe, et al.
Pubblicazione: (2024)
di: Zhang, Qizhe, et al.
Pubblicazione: (2024)
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning
di: Guo, Garvin, et al.
Pubblicazione: (2026)
di: Guo, Garvin, et al.
Pubblicazione: (2026)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks
di: Zhang, Yi, et al.
Pubblicazione: (2025)
di: Zhang, Yi, et al.
Pubblicazione: (2025)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
di: Li, Zejun, et al.
Pubblicazione: (2025)
di: Li, Zejun, et al.
Pubblicazione: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents
di: Kim, Dong-Hee, et al.
Pubblicazione: (2026)
di: Kim, Dong-Hee, et al.
Pubblicazione: (2026)
Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios
di: Corbière, Charles, et al.
Pubblicazione: (2025)
di: Corbière, Charles, et al.
Pubblicazione: (2025)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
di: Wu, Linquan, et al.
Pubblicazione: (2026)
di: Wu, Linquan, et al.
Pubblicazione: (2026)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
di: Du, Yifan, et al.
Pubblicazione: (2025)
di: Du, Yifan, et al.
Pubblicazione: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
di: Liu, Xiwei, et al.
Pubblicazione: (2026)
di: Liu, Xiwei, et al.
Pubblicazione: (2026)
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
di: Zhu, Xuanyu, et al.
Pubblicazione: (2026)
di: Zhu, Xuanyu, et al.
Pubblicazione: (2026)
Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement
di: Zhu, Zipeng, et al.
Pubblicazione: (2026)
di: Zhu, Zipeng, et al.
Pubblicazione: (2026)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
di: Yang, Zeyuan, et al.
Pubblicazione: (2025)
di: Yang, Zeyuan, et al.
Pubblicazione: (2025)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
di: Li, Yiwei, et al.
Pubblicazione: (2026)
di: Li, Yiwei, et al.
Pubblicazione: (2026)
Reinforcing Structured Chain-of-Thought for Video Understanding
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
di: Wang, Qixun, et al.
Pubblicazione: (2025)
di: Wang, Qixun, et al.
Pubblicazione: (2025)
Med-VRAgent: A Framework for Medical Visual Reasoning-Enhanced Agents
di: Guo, Guangfu, et al.
Pubblicazione: (2025)
di: Guo, Guangfu, et al.
Pubblicazione: (2025)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
di: Huang, YiJie, et al.
Pubblicazione: (2026)
di: Huang, YiJie, et al.
Pubblicazione: (2026)
Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models
di: Siddique, Md. Abu Bakor, et al.
Pubblicazione: (2026)
di: Siddique, Md. Abu Bakor, et al.
Pubblicazione: (2026)
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
di: Lee, Eunsoo, et al.
Pubblicazione: (2026)
di: Lee, Eunsoo, et al.
Pubblicazione: (2026)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
di: Qin, Jialong, et al.
Pubblicazione: (2025)
di: Qin, Jialong, et al.
Pubblicazione: (2025)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning
di: Mo, Ye, et al.
Pubblicazione: (2025)
di: Mo, Ye, et al.
Pubblicazione: (2025)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
di: Tian, Shulin, et al.
Pubblicazione: (2025)
di: Tian, Shulin, et al.
Pubblicazione: (2025)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
di: Shi, Fan, et al.
Pubblicazione: (2025)
di: Shi, Fan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026) -
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025) -
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025) -
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026) -
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
di: Jain, Riddhi, et al.
Pubblicazione: (2025)