Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zejun, Zhao, Yingxiu, Zhang, Jiwen, Wang, Siyuan, Yao, Yang, Zhao, Runzhou, Song, Jun, Zheng, Bo, Wei, Zhongyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
di: Li, Zejun, et al.
Pubblicazione: (2024)
di: Li, Zejun, et al.
Pubblicazione: (2024)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025)
di: Dong, Shuai, et al.
Pubblicazione: (2025)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
di: Li, Yaqi, et al.
Pubblicazione: (2025)
di: Li, Yaqi, et al.
Pubblicazione: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
di: Wang, Haicheng, et al.
Pubblicazione: (2026)
di: Wang, Haicheng, et al.
Pubblicazione: (2026)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
Simple o3: Towards Interleaved Vision-Language Reasoning
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
di: Wang, Siyuan, et al.
Pubblicazione: (2024)
di: Wang, Siyuan, et al.
Pubblicazione: (2024)
Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
di: Tan, Chuangchuang, et al.
Pubblicazione: (2025)
di: Tan, Chuangchuang, et al.
Pubblicazione: (2025)
Explicit Context Reasoning with Supervision for Visual Tracking
di: Zeng, Fansheng, et al.
Pubblicazione: (2025)
di: Zeng, Fansheng, et al.
Pubblicazione: (2025)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
di: Zhou, Yiyang, et al.
Pubblicazione: (2025)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
di: Wu, Linquan, et al.
Pubblicazione: (2026)
di: Wu, Linquan, et al.
Pubblicazione: (2026)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
di: Li, Chengzu, et al.
Pubblicazione: (2025)
di: Li, Chengzu, et al.
Pubblicazione: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
Artemis: Structured Visual Reasoning for Perception Policy Learning
di: Tang, Wei, et al.
Pubblicazione: (2025)
di: Tang, Wei, et al.
Pubblicazione: (2025)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
di: Li, Lingxiao, et al.
Pubblicazione: (2025)
di: Li, Lingxiao, et al.
Pubblicazione: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
di: Guo, Guangfu, et al.
Pubblicazione: (2026)
di: Guo, Guangfu, et al.
Pubblicazione: (2026)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
di: Zhang, Xintong, et al.
Pubblicazione: (2026)
di: Zhang, Xintong, et al.
Pubblicazione: (2026)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
di: Huang, Yixu, et al.
Pubblicazione: (2026)
di: Huang, Yixu, et al.
Pubblicazione: (2026)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance
di: Shen, Weijie, et al.
Pubblicazione: (2025)
di: Shen, Weijie, et al.
Pubblicazione: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
di: Wang, Dianyi, et al.
Pubblicazione: (2026)
di: Wang, Dianyi, et al.
Pubblicazione: (2026)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
di: Dong, Qihua, et al.
Pubblicazione: (2026)
di: Dong, Qihua, et al.
Pubblicazione: (2026)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
di: Acuna, David, et al.
Pubblicazione: (2025)
di: Acuna, David, et al.
Pubblicazione: (2025)
AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning
di: Yang, Dejie, et al.
Pubblicazione: (2025)
di: Yang, Dejie, et al.
Pubblicazione: (2025)
CATVis: Context-Aware Thought Visualization
di: Mehmood, Tariq, et al.
Pubblicazione: (2025)
di: Mehmood, Tariq, et al.
Pubblicazione: (2025)
Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering
di: Li, Tao, et al.
Pubblicazione: (2024)
di: Li, Tao, et al.
Pubblicazione: (2024)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
di: Yu, Jiaao, et al.
Pubblicazione: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
di: Li, Yian, et al.
Pubblicazione: (2026)
di: Li, Yian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
di: Li, Zejun, et al.
Pubblicazione: (2024) -
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
di: Dong, Shuai, et al.
Pubblicazione: (2025) -
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
di: Li, Yaqi, et al.
Pubblicazione: (2025) -
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026) -
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
di: Wang, Haicheng, et al.
Pubblicazione: (2026)