Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
Fuente:
arXiv
Guardado en:
| Autores principales: | Lai, Xin, Li, Junyi, Li, Wei, Liu, Tao, Li, Tianjian, Zhao, Hengshuang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)
por: Yang, Senqiao, et al.
Publicado: (2025)
MiniMax-01: Scaling Foundation Models with Lightning Attention
por: MiniMax, et al.
Publicado: (2025)
por: MiniMax, et al.
Publicado: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
por: Bai, Tianyi, et al.
Publicado: (2025)
por: Bai, Tianyi, et al.
Publicado: (2025)
VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning
por: Man, Fanhang, et al.
Publicado: (2025)
por: Man, Fanhang, et al.
Publicado: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
por: Ning, Zhiwei, et al.
Publicado: (2026)
por: Ning, Zhiwei, et al.
Publicado: (2026)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
por: Jia, Yiming, et al.
Publicado: (2025)
por: Jia, Yiming, et al.
Publicado: (2025)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
por: Li, Kaican, et al.
Publicado: (2025)
por: Li, Kaican, et al.
Publicado: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
por: Zhan, Shaoxiong, et al.
Publicado: (2026)
por: Zhan, Shaoxiong, et al.
Publicado: (2026)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
por: Wang, Yueqian, et al.
Publicado: (2025)
por: Wang, Yueqian, et al.
Publicado: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
por: Du, Yifan, et al.
Publicado: (2023)
por: Du, Yifan, et al.
Publicado: (2023)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
por: Guo, Jarvis, et al.
Publicado: (2024)
por: Guo, Jarvis, et al.
Publicado: (2024)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
por: Li, Shuang, et al.
Publicado: (2024)
por: Li, Shuang, et al.
Publicado: (2024)
Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation
por: Nilukshi, Shashini, et al.
Publicado: (2026)
por: Nilukshi, Shashini, et al.
Publicado: (2026)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
por: Li, Chengzu, et al.
Publicado: (2025)
por: Li, Chengzu, et al.
Publicado: (2025)
When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills
por: Wang, Yunfei, et al.
Publicado: (2026)
por: Wang, Yunfei, et al.
Publicado: (2026)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
por: Wei, Yana, et al.
Publicado: (2025)
por: Wei, Yana, et al.
Publicado: (2025)
FocalClick-XL: Towards Unified and High-quality Interactive Segmentation
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
MMSearch-R1: Incentivizing LMMs to Search
por: Wu, Jinming, et al.
Publicado: (2025)
por: Wu, Jinming, et al.
Publicado: (2025)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
por: Li, Yifan, et al.
Publicado: (2024)
por: Li, Yifan, et al.
Publicado: (2024)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
por: Li, Zhangpu, et al.
Publicado: (2024)
por: Li, Zhangpu, et al.
Publicado: (2024)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
por: Zhao, Yi, et al.
Publicado: (2026)
por: Zhao, Yi, et al.
Publicado: (2026)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
por: Ma, Mingjie, et al.
Publicado: (2024)
por: Ma, Mingjie, et al.
Publicado: (2024)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
por: Xu, Shilin, et al.
Publicado: (2025)
por: Xu, Shilin, et al.
Publicado: (2025)
Less is More: High-value Data Selection for Visual Instruction Tuning
por: Liu, Zikang, et al.
Publicado: (2024)
por: Liu, Zikang, et al.
Publicado: (2024)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
por: Zhao, Yu, et al.
Publicado: (2025)
por: Zhao, Yu, et al.
Publicado: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
por: Jiang, Houcheng, et al.
Publicado: (2026)
por: Jiang, Houcheng, et al.
Publicado: (2026)
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
por: Yuan, Zhihao, et al.
Publicado: (2023)
por: Yuan, Zhihao, et al.
Publicado: (2023)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
por: Hu, Juncheng, et al.
Publicado: (2026)
por: Hu, Juncheng, et al.
Publicado: (2026)
Ejemplares similares
-
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
por: Zhang, Wenqi, et al.
Publicado: (2025) -
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025) -
MiniMax-01: Scaling Foundation Models with Lightning Attention
por: MiniMax, et al.
Publicado: (2025) -
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026) -
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
por: Li, Yifan, et al.
Publicado: (2025)