Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Su, Zhaochen, Xia, Peng, Guo, Hangyu, Liu, Zhenhua, Ma, Yan, Qu, Xiaoye, Liu, Jiaqi, Li, Yanshu, Zeng, Kaide, Yang, Zhengyuan, Li, Linjie, Cheng, Yu, Ji, Heng, He, Junxian, Fung, Yi R. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
von: Su, Zhaochen, et al.
Veröffentlicht: (2026)
von: Su, Zhaochen, et al.
Veröffentlicht: (2026)
ConflictBank: A Benchmark for Evaluating the Influence of Knowledge Conflicts in LLM
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
Timo: Towards Better Temporal Reasoning for Language Models
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
von: Xia, Peng, et al.
Veröffentlicht: (2025)
von: Xia, Peng, et al.
Veröffentlicht: (2025)
PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
von: Song, Mingyang, et al.
Veröffentlicht: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
von: Li, Yanshu
Veröffentlicht: (2025)
von: Li, Yanshu
Veröffentlicht: (2025)
Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model
von: Fan, Chenghao, et al.
Veröffentlicht: (2026)
von: Fan, Chenghao, et al.
Veröffentlicht: (2026)
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
von: Huang, Shijue, et al.
Veröffentlicht: (2026)
von: Huang, Shijue, et al.
Veröffentlicht: (2026)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
von: Huang, Zhidian, et al.
Veröffentlicht: (2026)
von: Huang, Zhidian, et al.
Veröffentlicht: (2026)
Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
von: Liao, Jiaqi, et al.
Veröffentlicht: (2025)
von: Liao, Jiaqi, et al.
Veröffentlicht: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
von: Li, Yafu, et al.
Veröffentlicht: (2025)
von: Li, Yafu, et al.
Veröffentlicht: (2025)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
von: Sun, Jiashuo, et al.
Veröffentlicht: (2024)
von: Sun, Jiashuo, et al.
Veröffentlicht: (2024)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
von: Qu, Xiaoye, et al.
Veröffentlicht: (2025)
von: Qu, Xiaoye, et al.
Veröffentlicht: (2025)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
von: Chiang, Cheng-Han, et al.
Veröffentlicht: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
von: Xia, Peng, et al.
Veröffentlicht: (2025)
von: Xia, Peng, et al.
Veröffentlicht: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
von: Ni, Minheng, et al.
Veröffentlicht: (2025)
von: Ni, Minheng, et al.
Veröffentlicht: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2025)
von: Hao, Yunzhuo, et al.
Veröffentlicht: (2025)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
von: Wang, Alex Jinpeng, et al.
Veröffentlicht: (2025)
von: Wang, Alex Jinpeng, et al.
Veröffentlicht: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
von: Gu, Jiawei, et al.
Veröffentlicht: (2025)
von: Gu, Jiawei, et al.
Veröffentlicht: (2025)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
von: Yang, Jianjiang, et al.
Veröffentlicht: (2025)
von: Yang, Jianjiang, et al.
Veröffentlicht: (2025)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
von: Shen, Chuming, et al.
Veröffentlicht: (2025)
von: Shen, Chuming, et al.
Veröffentlicht: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
Diving into Self-Evolving Training for Multimodal Reasoning
von: Liu, Wei, et al.
Veröffentlicht: (2024)
von: Liu, Wei, et al.
Veröffentlicht: (2024)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
von: Xiang, Kun, et al.
Veröffentlicht: (2024)
von: Xiang, Kun, et al.
Veröffentlicht: (2024)
AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale
von: Ji, Yunjie, et al.
Veröffentlicht: (2025)
von: Ji, Yunjie, et al.
Veröffentlicht: (2025)
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
von: Peng, Yibo, et al.
Veröffentlicht: (2026)
von: Peng, Yibo, et al.
Veröffentlicht: (2026)
Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs
von: Li, Junxian, et al.
Veröffentlicht: (2025)
von: Li, Junxian, et al.
Veröffentlicht: (2025)
Draw with Thought: Unleashing Multimodal Reasoning for Scientific Diagram Generation
von: Cui, Zhiqing, et al.
Veröffentlicht: (2025)
von: Cui, Zhiqing, et al.
Veröffentlicht: (2025)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
von: Yu, Weihao, et al.
Veröffentlicht: (2023)
von: Yu, Weihao, et al.
Veröffentlicht: (2023)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
von: Fu, Tingchen, et al.
Veröffentlicht: (2025)
von: Fu, Tingchen, et al.
Veröffentlicht: (2025)
ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents
von: Lai, Yuxiang, et al.
Veröffentlicht: (2026)
von: Lai, Yuxiang, et al.
Veröffentlicht: (2026)
EMCompress: Video-LLMs with Endomorphic Multimodal Compression
von: Fan, Zheyu, et al.
Veröffentlicht: (2025)
von: Fan, Zheyu, et al.
Veröffentlicht: (2025)
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
von: Zhang, Kaichen, et al.
Veröffentlicht: (2025)
von: Zhang, Kaichen, et al.
Veröffentlicht: (2025)
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
von: Gui, Runquan, et al.
Veröffentlicht: (2026)
von: Gui, Runquan, et al.
Veröffentlicht: (2026)
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026) -
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025) -
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
von: Su, Zhaochen, et al.
Veröffentlicht: (2026) -
ConflictBank: A Benchmark for Evaluating the Influence of Knowledge Conflicts in LLM
von: Su, Zhaochen, et al.
Veröffentlicht: (2024) -
Timo: Towards Better Temporal Reasoning for Language Models
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)