Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Xiangyu, Zhang, Peiyuan, Lin, Junming, Liang, Tianhao, Duan, Yuchen, Ding, Shengyuan, Tian, Changyao, Zang, Yuhang, Yan, Junchi, Yang, Xue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing
di: Liu, Mingxin, et al.
Pubblicazione: (2026)
di: Liu, Mingxin, et al.
Pubblicazione: (2026)
Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
Visual-ERM: Reward Modeling for Visual Equivalence
di: Liu, Ziyu, et al.
Pubblicazione: (2026)
di: Liu, Ziyu, et al.
Pubblicazione: (2026)
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
From Faithfulness to Correctness: Generative Reward Models that Think Critically
di: Ma, Qiyao, et al.
Pubblicazione: (2025)
di: Ma, Qiyao, et al.
Pubblicazione: (2025)
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
di: Mei, Xiaoyong, et al.
Pubblicazione: (2026)
di: Mei, Xiaoyong, et al.
Pubblicazione: (2026)
Robust Knowledge Editing via Explicit Reasoning Chains for Distractor-Resilient Multi-Hop QA
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards
di: Guo, Kai-Yuan, et al.
Pubblicazione: (2026)
di: Guo, Kai-Yuan, et al.
Pubblicazione: (2026)
Visual Agentic Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
Inline Critic Steers Image Editing
di: Kang, Weitai, et al.
Pubblicazione: (2026)
di: Kang, Weitai, et al.
Pubblicazione: (2026)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
A fourth-order active flux method for parabolic problems with application to porous medium equation
di: Duan, Junming
Pubblicazione: (2025)
di: Duan, Junming
Pubblicazione: (2025)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
di: Tian, Rui, et al.
Pubblicazione: (2025)
di: Tian, Rui, et al.
Pubblicazione: (2025)
Towards Faithful and Controllable Personalization via Critique-Post-Edit Reinforcement Learning
di: Zhu, Chenghao, et al.
Pubblicazione: (2025)
di: Zhu, Chenghao, et al.
Pubblicazione: (2025)
GenExam: A Multidisciplinary Text-to-Image Exam
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
di: Wang, Haomin, et al.
Pubblicazione: (2026)
di: Wang, Haomin, et al.
Pubblicazione: (2026)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
di: Ping, Bowen, et al.
Pubblicazione: (2026)
di: Ping, Bowen, et al.
Pubblicazione: (2026)
The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
di: Chen, Zhuo, et al.
Pubblicazione: (2025)
di: Chen, Zhuo, et al.
Pubblicazione: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
To Trust Or Not To Trust Your Vision-Language Model's Prediction
di: Dong, Hao, et al.
Pubblicazione: (2025)
di: Dong, Hao, et al.
Pubblicazione: (2025)
ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework
di: Chen, Guanzhou, et al.
Pubblicazione: (2026)
di: Chen, Guanzhou, et al.
Pubblicazione: (2026)
Unified Reward Model for Multimodal Understanding and Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
GCE-MIL: Faithful and Recoverable Evidence for Multiple Instance Learning in Whole-Slide Imaging
di: Li, Xiangyu, et al.
Pubblicazione: (2026)
di: Li, Xiangyu, et al.
Pubblicazione: (2026)
Improving Diffusion-Based Image Editing Faithfulness via Guidance and Scheduling
di: Cho, Hansam, et al.
Pubblicazione: (2025)
di: Cho, Hansam, et al.
Pubblicazione: (2025)
ETCHR: Editing To Clarify and Harness Reasoning
di: Zhang, Beichen, et al.
Pubblicazione: (2026)
di: Zhang, Beichen, et al.
Pubblicazione: (2026)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
di: Zhang, Zhixiong, et al.
Pubblicazione: (2026)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025) -
SPARK: Synergistic Policy And Reward Co-Evolving Framework
di: Liu, Ziyu, et al.
Pubblicazione: (2025) -
GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing
di: Liu, Mingxin, et al.
Pubblicazione: (2026) -
Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
di: Wu, Yuchen, et al.
Pubblicazione: (2025) -
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
di: Zang, Yuhang, et al.
Pubblicazione: (2025)