VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Chaoya, Heng, Yongrui, Ye, Wei, Yang, Han, Xu, Haiyang, Yan, Ming, Zhang, Ji, Huang, Fei, Zhang, Shikun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
par: Jia, Hongrui, et autres
Publié: (2026)
par: Jia, Hongrui, et autres
Publié: (2026)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
par: Heng, Yongrui, et autres
Publié: (2026)
par: Heng, Yongrui, et autres
Publié: (2026)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
par: Jia, Hongrui, et autres
Publié: (2024)
par: Jia, Hongrui, et autres
Publié: (2024)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
par: Jia, Hongrui, et autres
Publié: (2025)
par: Jia, Hongrui, et autres
Publié: (2025)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Ye, Wei, et autres
Publié: (2024)
par: Ye, Wei, et autres
Publié: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
Exploiting Pseudo Image Captions for Multimodal Summarization
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Enhancing In-Context Learning via Implicit Demonstration Augmentation
par: Zhou, Xiaoling, et autres
Publié: (2024)
par: Zhou, Xiaoling, et autres
Publié: (2024)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
par: Wang, Yaoting, et autres
Publié: (2025)
par: Wang, Yaoting, et autres
Publié: (2025)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
par: Sun, Linzhuang, et autres
Publié: (2025)
par: Sun, Linzhuang, et autres
Publié: (2025)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
par: Zhang, Hongbo, et autres
Publié: (2025)
par: Zhang, Hongbo, et autres
Publié: (2025)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
par: Liu, Bo, et autres
Publié: (2025)
par: Liu, Bo, et autres
Publié: (2025)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
par: Jia, Hongrui, et autres
Publié: (2025)
par: Jia, Hongrui, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026)
par: Ma, Ji, et autres
Publié: (2026)
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
par: Huang, Chenxi, et autres
Publié: (2025)
par: Huang, Chenxi, et autres
Publié: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)
par: Peng, Yi, et autres
Publié: (2025)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
par: Ye, Jiacheng, et autres
Publié: (2024)
par: Ye, Jiacheng, et autres
Publié: (2024)
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
par: Liu, Shuhang, et autres
Publié: (2025)
par: Liu, Shuhang, et autres
Publié: (2025)
Perception-Aware Policy Optimization for Multimodal Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
Enhancing Interpretability in Software Change Management with Chain-of-Thought Reasoning
par: Sun, Yongqian, et autres
Publié: (2025)
par: Sun, Yongqian, et autres
Publié: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
par: Gao, Timin, et autres
Publié: (2024)
par: Gao, Timin, et autres
Publié: (2024)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
par: Mou, Yutao, et autres
Publié: (2025)
par: Mou, Yutao, et autres
Publié: (2025)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
par: Li, Sijing, et autres
Publié: (2026)
par: Li, Sijing, et autres
Publié: (2026)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
par: Zhang, Liang, et autres
Publié: (2024)
par: Zhang, Liang, et autres
Publié: (2024)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
Enhancing Automatic Chord Recognition through LLM Chain-of-Thought Reasoning
par: Chang, Chih-Cheng, et autres
Publié: (2025)
par: Chang, Chih-Cheng, et autres
Publié: (2025)
GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning
par: Yerramilli, Sahiti, et autres
Publié: (2025)
par: Yerramilli, Sahiti, et autres
Publié: (2025)
Conversational Orientation Reasoning: Egocentric-to-Allocentric Navigation with Multimodal Chain-of-Thought
par: Huang, Yu Ti
Publié: (2025)
par: Huang, Yu Ti
Publié: (2025)
SkinCaRe: A Multimodal Dermatology Dataset Annotated with Medical Caption and Chain-of-Thought Reasoning
par: Shen, Yuhao, et autres
Publié: (2024)
par: Shen, Yuhao, et autres
Publié: (2024)
Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding
par: Ouyang, Runqi, et autres
Publié: (2025)
par: Ouyang, Runqi, et autres
Publié: (2025)
Documents similaires
-
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
par: Jia, Hongrui, et autres
Publié: (2026) -
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
par: Heng, Yongrui, et autres
Publié: (2026) -
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024) -
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
par: Jia, Hongrui, et autres
Publié: (2024) -
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2023)