S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Qingxiao, Xu, Lifeng, Wang, QingLi, Bai, Yudong, Ou, Mingwei, Hu, Shu, Xu, Nan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
por: Shu, Yan, et al.
Publicado: (2025)
por: Shu, Yan, et al.
Publicado: (2025)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
por: Wen, Zichen, et al.
Publicado: (2026)
por: Wen, Zichen, et al.
Publicado: (2026)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
por: Fan, Kaixuan, et al.
Publicado: (2025)
por: Fan, Kaixuan, et al.
Publicado: (2025)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
por: Guo, Jarvis, et al.
Publicado: (2024)
por: Guo, Jarvis, et al.
Publicado: (2024)
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
por: Su, Yanzhou, et al.
Publicado: (2025)
por: Su, Yanzhou, et al.
Publicado: (2025)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
por: Wang, Xiaokun, et al.
Publicado: (2025)
por: Wang, Xiaokun, et al.
Publicado: (2025)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
por: Yuan, Ruifeng, et al.
Publicado: (2025)
por: Yuan, Ruifeng, et al.
Publicado: (2025)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
por: Tian, Changyao, et al.
Publicado: (2026)
por: Tian, Changyao, et al.
Publicado: (2026)
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
por: Su, Zhaochen, et al.
Publicado: (2025)
por: Su, Zhaochen, et al.
Publicado: (2025)
GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
por: Li, Tianbin, et al.
Publicado: (2024)
por: Li, Tianbin, et al.
Publicado: (2024)
Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images
por: Jiang, Zheng, et al.
Publicado: (2026)
por: Jiang, Zheng, et al.
Publicado: (2026)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
por: Li, Hengjia, et al.
Publicado: (2026)
por: Li, Hengjia, et al.
Publicado: (2026)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
por: Yang, Wenhao, et al.
Publicado: (2026)
por: Yang, Wenhao, et al.
Publicado: (2026)
ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models
por: Yi, Jingwei, et al.
Publicado: (2025)
por: Yi, Jingwei, et al.
Publicado: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
por: HyperAI Team, et al.
Publicado: (2025)
por: HyperAI Team, et al.
Publicado: (2025)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
por: Wang, Yuan, et al.
Publicado: (2026)
por: Wang, Yuan, et al.
Publicado: (2026)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
por: Yang, Wenhao, et al.
Publicado: (2025)
por: Yang, Wenhao, et al.
Publicado: (2025)
StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision
por: Lyu, Yuanhuiyi, et al.
Publicado: (2026)
por: Lyu, Yuanhuiyi, et al.
Publicado: (2026)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
por: Xiang, Kun, et al.
Publicado: (2024)
por: Xiang, Kun, et al.
Publicado: (2024)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
por: Zheng, Haojie, et al.
Publicado: (2024)
por: Zheng, Haojie, et al.
Publicado: (2024)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
por: Jin, Zhiwei, et al.
Publicado: (2025)
por: Jin, Zhiwei, et al.
Publicado: (2025)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
por: Huang, Tai-Ming, et al.
Publicado: (2025)
por: Huang, Tai-Ming, et al.
Publicado: (2025)
SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis
por: Lu, Zhixiang, et al.
Publicado: (2026)
por: Lu, Zhixiang, et al.
Publicado: (2026)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
DeepLatent: Think with Images via Parallel Latent Visual Reasoning
por: Lu, Dongchen, et al.
Publicado: (2026)
por: Lu, Dongchen, et al.
Publicado: (2026)
VL-Mamba: Exploring State Space Models for Multimodal Learning
por: Qiao, Yanyuan, et al.
Publicado: (2024)
por: Qiao, Yanyuan, et al.
Publicado: (2024)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
por: Li, Xueheng, et al.
Publicado: (2026)
por: Li, Xueheng, et al.
Publicado: (2026)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
EventVL: Understand Event Streams via Multimodal Large Language Model
por: Li, Pengteng, et al.
Publicado: (2025)
por: Li, Pengteng, et al.
Publicado: (2025)
Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning
por: Zhang, Lei, et al.
Publicado: (2026)
por: Zhang, Lei, et al.
Publicado: (2026)
Kwai Keye-VL 1.5 Technical Report
por: Yang, Biao, et al.
Publicado: (2025)
por: Yang, Biao, et al.
Publicado: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
por: Zhu, Jinguo, et al.
Publicado: (2025)
por: Zhu, Jinguo, et al.
Publicado: (2025)
Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
por: Li, Ouxiang, et al.
Publicado: (2025)
por: Li, Ouxiang, et al.
Publicado: (2025)
Kimi-VL Technical Report
por: Kimi Team, et al.
Publicado: (2025)
por: Kimi Team, et al.
Publicado: (2025)
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
por: Wang, Ke, et al.
Publicado: (2025)
por: Wang, Ke, et al.
Publicado: (2025)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2026)
por: Xiao, Wenyi, et al.
Publicado: (2026)
Ejemplares similares
-
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
por: Shu, Yan, et al.
Publicado: (2025) -
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
por: Wen, Zichen, et al.
Publicado: (2026) -
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
por: Fan, Kaixuan, et al.
Publicado: (2025) -
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
por: Guo, Jarvis, et al.
Publicado: (2024) -
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
por: Su, Yanzhou, et al.
Publicado: (2025)