From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Wenxin, Chen, Andong, Song, Yuchen, Chen, Kehai, Zhu, Conghui, Chen, Ziyan, Zhao, Tiejun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness
di: Song, Yuchen, et al.
Pubblicazione: (2025)
di: Song, Yuchen, et al.
Pubblicazione: (2025)
Evaluating o1-Like LLMs: Unlocking Reasoning for Translation through Comprehensive Analysis
di: Chen, Andong, et al.
Pubblicazione: (2025)
di: Chen, Andong, et al.
Pubblicazione: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine Translation
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
di: Lin, Junyan, et al.
Pubblicazione: (2024)
di: Lin, Junyan, et al.
Pubblicazione: (2024)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
di: Zhu, Yingjie, et al.
Pubblicazione: (2025)
di: Zhu, Yingjie, et al.
Pubblicazione: (2025)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
di: Liang, Yiming, et al.
Pubblicazione: (2026)
di: Liang, Yiming, et al.
Pubblicazione: (2026)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
di: Wang, Lu, et al.
Pubblicazione: (2026)
di: Wang, Lu, et al.
Pubblicazione: (2026)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
di: Tang, Yihong, et al.
Pubblicazione: (2026)
di: Tang, Yihong, et al.
Pubblicazione: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
di: Song, Xiujie, et al.
Pubblicazione: (2024)
di: Song, Xiujie, et al.
Pubblicazione: (2024)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
di: Huang, Yipo, et al.
Pubblicazione: (2024)
di: Huang, Yipo, et al.
Pubblicazione: (2024)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models
di: Zhu, Mengdan, et al.
Pubblicazione: (2024)
di: Zhu, Mengdan, et al.
Pubblicazione: (2024)
ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding
di: Yang, Jianjiang, et al.
Pubblicazione: (2025)
di: Yang, Jianjiang, et al.
Pubblicazione: (2025)
Mitigating Multimodal Hallucination via Phase-wise Self-reward
di: Zhang, Yu, et al.
Pubblicazione: (2026)
di: Zhang, Yu, et al.
Pubblicazione: (2026)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
di: Hong, Jindong, et al.
Pubblicazione: (2025)
di: Hong, Jindong, et al.
Pubblicazione: (2025)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
di: Chen, Haoyu, et al.
Pubblicazione: (2024)
di: Chen, Haoyu, et al.
Pubblicazione: (2024)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
di: Cai, Chen, et al.
Pubblicazione: (2024)
di: Cai, Chen, et al.
Pubblicazione: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
di: E, Shaojun, et al.
Pubblicazione: (2025)
di: E, Shaojun, et al.
Pubblicazione: (2025)
DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception
di: Luo, Run, et al.
Pubblicazione: (2024)
di: Luo, Run, et al.
Pubblicazione: (2024)
Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey
di: Qu, Bingzheng, et al.
Pubblicazione: (2026)
di: Qu, Bingzheng, et al.
Pubblicazione: (2026)
GenieBlue: Integrating both Linguistic and Multimodal Capabilities for Large Language Models on Mobile Devices
di: Lu, Xudong, et al.
Pubblicazione: (2025)
di: Lu, Xudong, et al.
Pubblicazione: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
di: Shang, Yuying, et al.
Pubblicazione: (2024)
di: Shang, Yuying, et al.
Pubblicazione: (2024)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
di: Huang, Yixu, et al.
Pubblicazione: (2026)
di: Huang, Yixu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness
di: Song, Yuchen, et al.
Pubblicazione: (2025) -
Evaluating o1-Like LLMs: Unlocking Reasoning for Translation through Comprehensive Analysis
di: Chen, Andong, et al.
Pubblicazione: (2025) -
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024) -
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025) -
Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine Translation
di: Chen, Andong, et al.
Pubblicazione: (2024)