Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zejun, Zhao, Yingxiu, Zhang, Jiwen, Wang, Siyuan, Yao, Yang, Zhao, Runzhou, Song, Jun, Zheng, Bo, Wei, Zhongyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024)
par: Li, Zejun, et autres
Publié: (2024)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
par: Dong, Shuai, et autres
Publié: (2025)
par: Dong, Shuai, et autres
Publié: (2025)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
par: Li, Yaqi, et autres
Publié: (2025)
par: Li, Yaqi, et autres
Publié: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
par: Zhang, Jiwen, et autres
Publié: (2026)
par: Zhang, Jiwen, et autres
Publié: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
par: Zhao, Kesen, et autres
Publié: (2025)
par: Zhao, Kesen, et autres
Publié: (2025)
Simple o3: Towards Interleaved Vision-Language Reasoning
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation
par: Zhang, Jiwen, et autres
Publié: (2026)
par: Zhang, Jiwen, et autres
Publié: (2026)
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
par: Tan, Chuangchuang, et autres
Publié: (2025)
par: Tan, Chuangchuang, et autres
Publié: (2025)
Explicit Context Reasoning with Supervision for Visual Tracking
par: Zeng, Fansheng, et autres
Publié: (2025)
par: Zeng, Fansheng, et autres
Publié: (2025)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
par: Wu, Linquan, et autres
Publié: (2026)
par: Wu, Linquan, et autres
Publié: (2026)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
Artemis: Structured Visual Reasoning for Perception Policy Learning
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
par: Li, Lingxiao, et autres
Publié: (2025)
par: Li, Lingxiao, et autres
Publié: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
par: Guo, Guangfu, et autres
Publié: (2026)
par: Guo, Guangfu, et autres
Publié: (2026)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
par: Zhang, Xintong, et autres
Publié: (2026)
par: Zhang, Xintong, et autres
Publié: (2026)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
par: Huang, Yixu, et autres
Publié: (2026)
par: Huang, Yixu, et autres
Publié: (2026)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
par: Ji, Yuheng, et autres
Publié: (2025)
par: Ji, Yuheng, et autres
Publié: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance
par: Shen, Weijie, et autres
Publié: (2025)
par: Shen, Weijie, et autres
Publié: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
par: Zhang, Huanyu, et autres
Publié: (2025)
par: Zhang, Huanyu, et autres
Publié: (2025)
UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
par: Wang, Dianyi, et autres
Publié: (2026)
par: Wang, Dianyi, et autres
Publié: (2026)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
par: Wang, Jianghui, et autres
Publié: (2023)
par: Wang, Jianghui, et autres
Publié: (2023)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
par: Dong, Qihua, et autres
Publié: (2026)
par: Dong, Qihua, et autres
Publié: (2026)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
par: Acuna, David, et autres
Publié: (2025)
par: Acuna, David, et autres
Publié: (2025)
AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning
par: Yang, Dejie, et autres
Publié: (2025)
par: Yang, Dejie, et autres
Publié: (2025)
CATVis: Context-Aware Thought Visualization
par: Mehmood, Tariq, et autres
Publié: (2025)
par: Mehmood, Tariq, et autres
Publié: (2025)
Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering
par: Li, Tao, et autres
Publié: (2024)
par: Li, Tao, et autres
Publié: (2024)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
par: Jain, Riddhi, et autres
Publié: (2025)
par: Jain, Riddhi, et autres
Publié: (2025)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
par: Li, Yian, et autres
Publié: (2026)
par: Li, Yian, et autres
Publié: (2026)
Documents similaires
-
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024) -
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
par: Dong, Shuai, et autres
Publié: (2025) -
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
par: Li, Yaqi, et autres
Publié: (2025) -
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
par: Wang, Yifan, et autres
Publié: (2026) -
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)