Thinking with Programming Vision: Towards a Unified View for Thinking with Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Zirun, Hong, Minjie, Zhang, Feng, Jia, Kai, Jin, Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
par: Tao, Xingjian, et autres
Publié: (2026)
par: Tao, Xingjian, et autres
Publié: (2026)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
par: Cheng, Sijie, et autres
Publié: (2023)
par: Cheng, Sijie, et autres
Publié: (2023)
LLM-I: LLMs are Naturally Interleaved Multimodal Creators
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Thinking with Generated Images
par: Chern, Ethan, et autres
Publié: (2025)
par: Chern, Ethan, et autres
Publié: (2025)
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
par: Qian, Kangan, et autres
Publié: (2025)
par: Qian, Kangan, et autres
Publié: (2025)
Re-Thinking Inverse Graphics With Large Language Models
par: Kulits, Peter, et autres
Publié: (2024)
par: Kulits, Peter, et autres
Publié: (2024)
GRIT: Teaching MLLMs to Think with Images
par: Fan, Yue, et autres
Publié: (2025)
par: Fan, Yue, et autres
Publié: (2025)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
When to Think and When to Look: Uncertainty-Guided Lookback
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
par: Yang, Senqiao, et autres
Publié: (2025)
par: Yang, Senqiao, et autres
Publié: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
par: Tong, Jingqi, et autres
Publié: (2025)
par: Tong, Jingqi, et autres
Publié: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
par: Xiao, Wenyi, et autres
Publié: (2025)
par: Xiao, Wenyi, et autres
Publié: (2025)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
par: Xu, Haolei, et autres
Publié: (2026)
par: Xu, Haolei, et autres
Publié: (2026)
Visual Planning: Let's Think Only with Images
par: Xu, Yi, et autres
Publié: (2025)
par: Xu, Yi, et autres
Publié: (2025)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
par: Hu, Juncheng, et autres
Publié: (2026)
par: Hu, Juncheng, et autres
Publié: (2026)
See, Think, Learn: A Self-Taught Multimodal Reasoner
par: Sharma, Sourabh, et autres
Publié: (2025)
par: Sharma, Sourabh, et autres
Publié: (2025)
RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation
par: Liu, Fanfan, et autres
Publié: (2024)
par: Liu, Fanfan, et autres
Publié: (2024)
SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
par: Shu, Fangxun, et autres
Publié: (2025)
par: Shu, Fangxun, et autres
Publié: (2025)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
par: Sun, Kaiser, et autres
Publié: (2026)
par: Sun, Kaiser, et autres
Publié: (2026)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
par: Zhu, Wenxin, et autres
Publié: (2025)
par: Zhu, Wenxin, et autres
Publié: (2025)
Low-rank Prompt Interaction for Continual Vision-Language Retrieval
par: Yan, Weicai, et autres
Publié: (2025)
par: Yan, Weicai, et autres
Publié: (2025)
VideoScore2: Think before You Score in Generative Video Evaluation
par: He, Xuan, et autres
Publié: (2025)
par: He, Xuan, et autres
Publié: (2025)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
par: Zhan, Shaoxiong, et autres
Publié: (2026)
par: Zhan, Shaoxiong, et autres
Publié: (2026)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference
par: Hojjat, Ali, et autres
Publié: (2025)
par: Hojjat, Ali, et autres
Publié: (2025)
Documents similaires
-
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024) -
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025) -
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
par: Tao, Xingjian, et autres
Publié: (2026) -
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
par: Cheng, Sijie, et autres
Publié: (2023) -
LLM-I: LLMs are Naturally Interleaved Multimodal Creators
par: Guo, Zirun, et autres
Publié: (2025)