See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Zhiheng, Wang, Tong, Wang, Shuning, Liu, Naiming, Zhang, Yumeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
par: Yu, Seonghoon, et autres
Publié: (2026)
par: Yu, Seonghoon, et autres
Publié: (2026)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)
par: Chen, Kaitao, et autres
Publié: (2025)
Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
par: Lu, Wenting, et autres
Publié: (2026)
par: Lu, Wenting, et autres
Publié: (2026)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
par: Wang, Haozhe, et autres
Publié: (2026)
par: Wang, Haozhe, et autres
Publié: (2026)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent
par: Tang, Tianci, et autres
Publié: (2026)
par: Tang, Tianci, et autres
Publié: (2026)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
par: Liu, Chengzhi, et autres
Publié: (2025)
par: Liu, Chengzhi, et autres
Publié: (2025)
MediSee: Reasoning-based Pixel-level Perception in Medical Images
par: Tong, Qinyue, et autres
Publié: (2025)
par: Tong, Qinyue, et autres
Publié: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
par: Wang, Zhaozhi, et autres
Publié: (2025)
par: Wang, Zhaozhi, et autres
Publié: (2025)
Beyond Frequency: Seeing Subtle Cues Through the Lens of Spatial Decomposition for Fine-Grained Visual Classification
par: Xu, Qin, et autres
Publié: (2025)
par: Xu, Qin, et autres
Publié: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
par: Qin, Yiming, et autres
Publié: (2025)
par: Qin, Yiming, et autres
Publié: (2025)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
par: Gao, Mingjian, et autres
Publié: (2026)
par: Gao, Mingjian, et autres
Publié: (2026)
Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT
par: Dong, Zhuobai, et autres
Publié: (2025)
par: Dong, Zhuobai, et autres
Publié: (2025)
TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning
par: Liu, Junhua, et autres
Publié: (2026)
par: Liu, Junhua, et autres
Publié: (2026)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
par: Liu, Tianhui, et autres
Publié: (2026)
par: Liu, Tianhui, et autres
Publié: (2026)
Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning
par: Wang, Wentao, et autres
Publié: (2025)
par: Wang, Wentao, et autres
Publié: (2025)
Belief-Aware VLM Model for Human-like Reasoning
par: Nayak, Anshul, et autres
Publié: (2026)
par: Nayak, Anshul, et autres
Publié: (2026)
Unlocking Feature Visualization for Deeper Networks with MAgnitude Constrained Optimization
par: Fel, Thomas, et autres
Publié: (2023)
par: Fel, Thomas, et autres
Publié: (2023)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
par: Li, Yiwei, et autres
Publié: (2026)
par: Li, Yiwei, et autres
Publié: (2026)
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
par: Duan, Chengqi, et autres
Publié: (2025)
par: Duan, Chengqi, et autres
Publié: (2025)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
par: Lin, Jiawen, et autres
Publié: (2025)
par: Lin, Jiawen, et autres
Publié: (2025)
MedHorizon: Towards Long-context Medical Video Understanding in the Wild
par: Du, Bodong, et autres
Publié: (2026)
par: Du, Bodong, et autres
Publié: (2026)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
Enhancing Spatial Reasoning through Visual and Textual Thinking
par: Liang, Xun, et autres
Publié: (2025)
par: Liang, Xun, et autres
Publié: (2025)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
par: Jing, Miao, et autres
Publié: (2025)
par: Jing, Miao, et autres
Publié: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
par: Zhang, Jialiang, et autres
Publié: (2026)
par: Zhang, Jialiang, et autres
Publié: (2026)
Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models
par: Peng, Ruiying, et autres
Publié: (2026)
par: Peng, Ruiying, et autres
Publié: (2026)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
par: Wu, Kui, et autres
Publié: (2025)
par: Wu, Kui, et autres
Publié: (2025)
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
par: Ma, Xueqi, et autres
Publié: (2026)
par: Ma, Xueqi, et autres
Publié: (2026)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
par: Zhang, Huaxiang, et autres
Publié: (2024)
par: Zhang, Huaxiang, et autres
Publié: (2024)
See Further for Parameter Efficient Fine-tuning by Standing on the Shoulders of Decomposition
par: Si, Chongjie, et autres
Publié: (2024)
par: Si, Chongjie, et autres
Publié: (2024)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
par: Pang, Yuqi, et autres
Publié: (2025)
par: Pang, Yuqi, et autres
Publié: (2025)
DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM
par: Wu, Yixuan, et autres
Publié: (2024)
par: Wu, Yixuan, et autres
Publié: (2024)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
par: Xu, Haoran, et autres
Publié: (2026)
par: Xu, Haoran, et autres
Publié: (2026)
Documents similaires
-
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
par: Yu, Seonghoon, et autres
Publié: (2026) -
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025) -
Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
par: Lu, Wenting, et autres
Publié: (2026) -
Enhancing Advanced Visual Reasoning Ability of Large Language Models
par: Li, Zhiyuan, et autres
Publié: (2024) -
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
par: Wang, Haozhe, et autres
Publié: (2026)