Diving into Self-Evolving Training for Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Wei, Li, Junlong, Zhang, Xiwen, Zhou, Fan, Cheng, Yu, He, Junxian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RewardHarness: Self-Evolving Agentic Post-Training
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models
di: Chen, Zijun, et al.
Pubblicazione: (2024)
di: Chen, Zijun, et al.
Pubblicazione: (2024)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
VisPlay: Self-Evolving Vision-Language Models from Images
di: He, Yicheng, et al.
Pubblicazione: (2025)
di: He, Yicheng, et al.
Pubblicazione: (2025)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
di: Chang, Kai-Po, et al.
Pubblicazione: (2025)
di: Chang, Kai-Po, et al.
Pubblicazione: (2025)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
di: Lin, Bingqian, et al.
Pubblicazione: (2025)
di: Lin, Bingqian, et al.
Pubblicazione: (2025)
Multimodal Tabular Reasoning with Privileged Structured Information
di: Jiang, Jun-Peng, et al.
Pubblicazione: (2025)
di: Jiang, Jun-Peng, et al.
Pubblicazione: (2025)
Advancing Conversational Diagnostic AI with Multimodal Reasoning
di: Saab, Khaled, et al.
Pubblicazione: (2025)
di: Saab, Khaled, et al.
Pubblicazione: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
di: Chen, Shuang, et al.
Pubblicazione: (2025)
di: Chen, Shuang, et al.
Pubblicazione: (2025)
A Survey of Reasoning with Foundation Models
di: Sun, Jiankai, et al.
Pubblicazione: (2023)
di: Sun, Jiankai, et al.
Pubblicazione: (2023)
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
di: Wei, Lai, et al.
Pubblicazione: (2025)
di: Wei, Lai, et al.
Pubblicazione: (2025)
Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
di: Zhu, Yinglun, et al.
Pubblicazione: (2025)
di: Zhu, Yinglun, et al.
Pubblicazione: (2025)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
di: Chen, Xiuwei, et al.
Pubblicazione: (2025)
di: Chen, Xiuwei, et al.
Pubblicazione: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
di: Xia, Peng, et al.
Pubblicazione: (2025)
di: Xia, Peng, et al.
Pubblicazione: (2025)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
di: Zhang, Jingyi, et al.
Pubblicazione: (2025)
di: Zhang, Jingyi, et al.
Pubblicazione: (2025)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems
di: Zhang, Zhiqian, et al.
Pubblicazione: (2026)
di: Zhang, Zhiqian, et al.
Pubblicazione: (2026)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
di: Liao, Huanxuan, et al.
Pubblicazione: (2026)
di: Liao, Huanxuan, et al.
Pubblicazione: (2026)
MemeMind: A Large-Scale Multimodal Dataset with Chain-of-Thought Reasoning for Harmful Meme Detection
di: Gu, Hexiang, et al.
Pubblicazione: (2025)
di: Gu, Hexiang, et al.
Pubblicazione: (2025)
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
di: Cai, Zikui, et al.
Pubblicazione: (2025)
di: Cai, Zikui, et al.
Pubblicazione: (2025)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
di: Yuan, Qianhao, et al.
Pubblicazione: (2026)
di: Yuan, Qianhao, et al.
Pubblicazione: (2026)
MultiDelete for Multimodal Machine Unlearning
di: Cheng, Jiali, et al.
Pubblicazione: (2023)
di: Cheng, Jiali, et al.
Pubblicazione: (2023)
Visual Question Decomposition on Multimodal Large Language Models
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
di: Zhang, Haowei, et al.
Pubblicazione: (2024)
Steering the Verifiability of Multimodal AI Hallucinations
di: Pang, Jianhong, et al.
Pubblicazione: (2026)
di: Pang, Jianhong, et al.
Pubblicazione: (2026)
Bridging the Gap Between Multimodal Foundation Models and World Models
di: He, Xuehai
Pubblicazione: (2025)
di: He, Xuehai
Pubblicazione: (2025)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
di: Deng, Shijian, et al.
Pubblicazione: (2024)
di: Deng, Shijian, et al.
Pubblicazione: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
di: Yue, Xiang, et al.
Pubblicazione: (2023)
di: Yue, Xiang, et al.
Pubblicazione: (2023)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
di: Chiu, Bo-Cheng, et al.
Pubblicazione: (2025)
di: Chiu, Bo-Cheng, et al.
Pubblicazione: (2025)
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RewardHarness: Self-Evolving Agentic Post-Training
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026) -
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
di: Yu, Jiazuo, et al.
Pubblicazione: (2024) -
Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models
di: Chen, Zijun, et al.
Pubblicazione: (2024) -
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024) -
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)