Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
Fuente:
arXiv
Salvato in:
| Autori principali: | Jia, Zhiwei, Nan, Yuesong, Zhao, Huixi, Liu, Gengdai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Directly Fine-Tuning Diffusion Models on Differentiable Rewards
di: Clark, Kevin, et al.
Pubblicazione: (2023)
di: Clark, Kevin, et al.
Pubblicazione: (2023)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
di: Kim, Kwanyoung, et al.
Pubblicazione: (2026)
di: Kim, Kwanyoung, et al.
Pubblicazione: (2026)
Fine-Tuning Language Models with Reward Learning on Policy
di: Lang, Hao, et al.
Pubblicazione: (2024)
di: Lang, Hao, et al.
Pubblicazione: (2024)
Iterative Foundation Model Fine-Tuning on Multiple Rewards
di: Ghari, Pouya M., et al.
Pubblicazione: (2025)
di: Ghari, Pouya M., et al.
Pubblicazione: (2025)
Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design
di: Su, Xingyu, et al.
Pubblicazione: (2025)
di: Su, Xingyu, et al.
Pubblicazione: (2025)
Fine-Tuning Discrete Diffusion Models via Reward Optimization with Applications to DNA and Protein Design
di: Wang, Chenyu, et al.
Pubblicazione: (2024)
di: Wang, Chenyu, et al.
Pubblicazione: (2024)
RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning
di: Liu, Zehua, et al.
Pubblicazione: (2026)
di: Liu, Zehua, et al.
Pubblicazione: (2026)
The Trajectory Alignment Coefficient in Two Acts: From Reward Tuning to Reward Learning
di: Muslimani, Calarina, et al.
Pubblicazione: (2026)
di: Muslimani, Calarina, et al.
Pubblicazione: (2026)
PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
di: Yuan, Mingze, et al.
Pubblicazione: (2025)
di: Yuan, Mingze, et al.
Pubblicazione: (2025)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
di: Huang, Tao, et al.
Pubblicazione: (2023)
di: Huang, Tao, et al.
Pubblicazione: (2023)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
Aligning Few-Step Diffusion Models with Dense Reward Difference Learning
di: Zhang, Ziyi, et al.
Pubblicazione: (2024)
di: Zhang, Ziyi, et al.
Pubblicazione: (2024)
Expert Proximity as Surrogate Rewards for Single Demonstration Imitation Learning
di: Chiang, Chia-Cheng, et al.
Pubblicazione: (2024)
di: Chiang, Chia-Cheng, et al.
Pubblicazione: (2024)
Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
Fine-Tuning Diffusion-Based Recommender Systems via Reinforcement Learning with Reward Function Optimization
di: Hou, Yu, et al.
Pubblicazione: (2025)
di: Hou, Yu, et al.
Pubblicazione: (2025)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
di: Ma, Yiran, et al.
Pubblicazione: (2024)
di: Ma, Yiran, et al.
Pubblicazione: (2024)
Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models
di: Lee, Jeongjae, et al.
Pubblicazione: (2026)
di: Lee, Jeongjae, et al.
Pubblicazione: (2026)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
di: Ji, Wenlong, et al.
Pubblicazione: (2025)
di: Ji, Wenlong, et al.
Pubblicazione: (2025)
Beyond Semantic Manipulation: Token-Space Attacks on Reward Models
di: Zhang, Yuheng, et al.
Pubblicazione: (2026)
di: Zhang, Yuheng, et al.
Pubblicazione: (2026)
Efficient Differentially Private Fine-Tuning of Diffusion Models
di: Liu, Jing, et al.
Pubblicazione: (2024)
di: Liu, Jing, et al.
Pubblicazione: (2024)
Representation Without Reward: A JEPA Audit for LLM Fine-Tuning
di: Sengupta, Biswa
Pubblicazione: (2026)
di: Sengupta, Biswa
Pubblicazione: (2026)
Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization
di: Adams, Carter, et al.
Pubblicazione: (2026)
di: Adams, Carter, et al.
Pubblicazione: (2026)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
di: Zhang, Ruiyi, et al.
Pubblicazione: (2026)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2026)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
di: Jia, Chen
Pubblicazione: (2024)
di: Jia, Chen
Pubblicazione: (2024)
Probabilistic Uncertain Reward Model
di: Sun, Wangtao, et al.
Pubblicazione: (2025)
di: Sun, Wangtao, et al.
Pubblicazione: (2025)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization
di: Cao, Wenjun
Pubblicazione: (2025)
di: Cao, Wenjun
Pubblicazione: (2025)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
di: Yu, Zhang Ze, et al.
Pubblicazione: (2023)
di: Yu, Zhang Ze, et al.
Pubblicazione: (2023)
Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization
di: Fan, Jiajun, et al.
Pubblicazione: (2025)
di: Fan, Jiajun, et al.
Pubblicazione: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment
di: Verma, Richa, et al.
Pubblicazione: (2026)
di: Verma, Richa, et al.
Pubblicazione: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Reward-Directed Score-Based Diffusion Models via q-Learning
di: Gao, Xuefeng, et al.
Pubblicazione: (2024)
di: Gao, Xuefeng, et al.
Pubblicazione: (2024)
RewardBench: Evaluating Reward Models for Language Modeling
di: Lambert, Nathan, et al.
Pubblicazione: (2024)
di: Lambert, Nathan, et al.
Pubblicazione: (2024)
Diffusion-Reward Adversarial Imitation Learning
di: Lai, Chun-Mao, et al.
Pubblicazione: (2024)
di: Lai, Chun-Mao, et al.
Pubblicazione: (2024)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)
di: Huang, Yu, et al.
Pubblicazione: (2026)
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
di: Deng, Fei, et al.
Pubblicazione: (2024)
di: Deng, Fei, et al.
Pubblicazione: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Directly Fine-Tuning Diffusion Models on Differentiable Rewards
di: Clark, Kevin, et al.
Pubblicazione: (2023) -
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
di: Kim, Kwanyoung, et al.
Pubblicazione: (2026) -
Fine-Tuning Language Models with Reward Learning on Policy
di: Lang, Hao, et al.
Pubblicazione: (2024) -
Iterative Foundation Model Fine-Tuning on Multiple Rewards
di: Ghari, Pouya M., et al.
Pubblicazione: (2025) -
Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design
di: Su, Xingyu, et al.
Pubblicazione: (2025)