Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yibin, Li, Zhimin, Zang, Yuhang, Wang, Chunyu, Lu, Qinglin, Jin, Cheng, Wang, Jiaqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unified Reward Model for Multimodal Understanding and Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Unified Personalized Reward Model for Vision Generation
di: Wang, Yibin, et al.
Pubblicazione: (2026)
di: Wang, Yibin, et al.
Pubblicazione: (2026)
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Visual Agentic Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
Fine-Grained GRPO for Precise Preference Alignment in Flow Models
di: Zhou, Yujie, et al.
Pubblicazione: (2025)
di: Zhou, Yujie, et al.
Pubblicazione: (2025)
Generative Visual Chain-of-Thought for Image Editing
di: Yin, Zijin, et al.
Pubblicazione: (2026)
di: Yin, Zijin, et al.
Pubblicazione: (2026)
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
di: Guo, Jiayi, et al.
Pubblicazione: (2026)
di: Guo, Jiayi, et al.
Pubblicazione: (2026)
DiCache: Let Diffusion Model Determine Its Own Cache
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
di: Jin, Weiyang, et al.
Pubblicazione: (2025)
di: Jin, Weiyang, et al.
Pubblicazione: (2025)
PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
di: Wang, Linqing, et al.
Pubblicazione: (2025)
di: Wang, Linqing, et al.
Pubblicazione: (2025)
Unified Scene Representation and Reconstruction for 3D Large Language Models
di: Chu, Tao, et al.
Pubblicazione: (2024)
di: Chu, Tao, et al.
Pubblicazione: (2024)
$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
di: Ye, Yuqi, et al.
Pubblicazione: (2026)
di: Ye, Yuqi, et al.
Pubblicazione: (2026)
BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards
di: Yang, Yiran, et al.
Pubblicazione: (2026)
di: Yang, Yiran, et al.
Pubblicazione: (2026)
MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation
di: Tan, Xiaofeng, et al.
Pubblicazione: (2026)
di: Tan, Xiaofeng, et al.
Pubblicazione: (2026)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
di: Wu, Jiahe, et al.
Pubblicazione: (2026)
di: Wu, Jiahe, et al.
Pubblicazione: (2026)
USV: Unified Sparsification for Accelerating Video Diffusion Models
di: Wu, Xinjian, et al.
Pubblicazione: (2025)
di: Wu, Xinjian, et al.
Pubblicazione: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension
di: Li, Lin, et al.
Pubblicazione: (2025)
di: Li, Lin, et al.
Pubblicazione: (2025)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
di: Zhang, Zhixiong, et al.
Pubblicazione: (2026)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2026)
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
di: Chen, Leon Liangyu, et al.
Pubblicazione: (2026)
di: Chen, Leon Liangyu, et al.
Pubblicazione: (2026)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
di: Gu, Jiawei, et al.
Pubblicazione: (2025)
di: Gu, Jiawei, et al.
Pubblicazione: (2025)
Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition
di: Ling, Pengyang, et al.
Pubblicazione: (2026)
di: Ling, Pengyang, et al.
Pubblicazione: (2026)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
di: Li, Jinsong, et al.
Pubblicazione: (2026)
di: Li, Jinsong, et al.
Pubblicazione: (2026)
DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement
di: Lu, Renjie, et al.
Pubblicazione: (2026)
di: Lu, Renjie, et al.
Pubblicazione: (2026)
Arbitrary Generative Video Interpolation
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
di: Chen, Honghao, et al.
Pubblicazione: (2025)
di: Chen, Honghao, et al.
Pubblicazione: (2025)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
di: Han, Feng, et al.
Pubblicazione: (2025)
di: Han, Feng, et al.
Pubblicazione: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
di: Li, Hengtao, et al.
Pubblicazione: (2025)
di: Li, Hengtao, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unified Reward Model for Multimodal Understanding and Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025) -
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
di: Wang, Yibin, et al.
Pubblicazione: (2025) -
Unified Personalized Reward Model for Vision Generation
di: Wang, Yibin, et al.
Pubblicazione: (2026) -
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025) -
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)