Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Junfei, Guan, Jian, Feng, Kaituo, Liu, Qiang, Wu, Shu, Wang, Liang, Wu, Wei, Tan, Tieniu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chatting with Images for Introspective Visual Thinking
por: Wu, Junfei, et al.
Publicado: (2026)
por: Wu, Junfei, et al.
Publicado: (2026)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
por: Wu, Junfei, et al.
Publicado: (2024)
por: Wu, Junfei, et al.
Publicado: (2024)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
por: Huang, Han, et al.
Publicado: (2024)
por: Huang, Han, et al.
Publicado: (2024)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
por: Fan, Kaixuan, et al.
Publicado: (2025)
por: Fan, Kaixuan, et al.
Publicado: (2025)
Video-R1: Reinforcing Video Reasoning in MLLMs
por: Feng, Kaituo, et al.
Publicado: (2025)
por: Feng, Kaituo, et al.
Publicado: (2025)
The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
por: Sheng, Lijun, et al.
Publicado: (2025)
por: Sheng, Lijun, et al.
Publicado: (2025)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
por: Jian, Pu, et al.
Publicado: (2025)
por: Jian, Pu, et al.
Publicado: (2025)
Towards Compatible Fine-tuning for Vision-Language Model Updates
por: Wang, Zhengbo, et al.
Publicado: (2024)
por: Wang, Zhengbo, et al.
Publicado: (2024)
Connecting the Dots: Collaborative Fine-tuning for Black-Box Vision-Language Models
por: Wang, Zhengbo, et al.
Publicado: (2024)
por: Wang, Zhengbo, et al.
Publicado: (2024)
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
por: Sun, Peiwen, et al.
Publicado: (2025)
por: Sun, Peiwen, et al.
Publicado: (2025)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
por: Huang, Chi-Pin, et al.
Publicado: (2025)
por: Huang, Chi-Pin, et al.
Publicado: (2025)
Reinforcing Video Reasoning with Focused Thinking
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
From Web to Pixels: Bringing Agentic Search into Visual Perception
por: Yang, Bokang, et al.
Publicado: (2026)
por: Yang, Bokang, et al.
Publicado: (2026)
Think3D: Thinking with Space for Spatial Reasoning
por: Zhang, Zaibin, et al.
Publicado: (2026)
por: Zhang, Zaibin, et al.
Publicado: (2026)
Learning to Think Fast and Slow for Visual Language Models
por: Lin, Chenyu, et al.
Publicado: (2025)
por: Lin, Chenyu, et al.
Publicado: (2025)
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
por: Wu, Tianhe, et al.
Publicado: (2025)
por: Wu, Tianhe, et al.
Publicado: (2025)
Thinking with Spatial Code for Physical-World Video Reasoning
por: Chen, Jieneng, et al.
Publicado: (2026)
por: Chen, Jieneng, et al.
Publicado: (2026)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
por: Wang, Jiaqi, et al.
Publicado: (2025)
por: Wang, Jiaqi, et al.
Publicado: (2025)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
por: Wu, Aodi, et al.
Publicado: (2025)
por: Wu, Aodi, et al.
Publicado: (2025)
A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts
por: Liang, Jian, et al.
Publicado: (2023)
por: Liang, Jian, et al.
Publicado: (2023)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
por: Ma, Weijian, et al.
Publicado: (2026)
por: Ma, Weijian, et al.
Publicado: (2026)
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
por: Deng, Wei, et al.
Publicado: (2026)
por: Deng, Wei, et al.
Publicado: (2026)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
por: Zhang, Jinglei, et al.
Publicado: (2025)
por: Zhang, Jinglei, et al.
Publicado: (2025)
Enhancing Spatial Reasoning through Visual and Textual Thinking
por: Liang, Xun, et al.
Publicado: (2025)
por: Liang, Xun, et al.
Publicado: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
por: Li, Wenshuai, et al.
Publicado: (2026)
por: Li, Wenshuai, et al.
Publicado: (2026)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
por: Li, Hengjia, et al.
Publicado: (2026)
por: Li, Hengjia, et al.
Publicado: (2026)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
por: Li, Ling, et al.
Publicado: (2025)
por: Li, Ling, et al.
Publicado: (2025)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
por: Yang, Jie, et al.
Publicado: (2025)
por: Yang, Jie, et al.
Publicado: (2025)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
por: Khan, Muhammad Tayyab, et al.
Publicado: (2024)
por: Khan, Muhammad Tayyab, et al.
Publicado: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
por: Rahman, Amirul, et al.
Publicado: (2025)
por: Rahman, Amirul, et al.
Publicado: (2025)
CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
Vision Transformer with Super Token Sampling
por: Huang, Huaibo, et al.
Publicado: (2022)
por: Huang, Huaibo, et al.
Publicado: (2022)
Ejemplares similares
-
Chatting with Images for Introspective Visual Thinking
por: Wu, Junfei, et al.
Publicado: (2026) -
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
por: Wu, Junfei, et al.
Publicado: (2024) -
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
por: Chen, Xinlong, et al.
Publicado: (2025) -
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
por: Huang, Han, et al.
Publicado: (2024) -
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
por: Fan, Kaixuan, et al.
Publicado: (2025)