PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Fei, Wang, Qifei, Wei, Wei, Grundmann, Matthias, Hou, Tingbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
di: Kim, Yeongmin, et al.
Pubblicazione: (2026)
di: Kim, Yeongmin, et al.
Pubblicazione: (2026)
RewardAnything: Generalizable Principle-Following Reward Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
In-Context Reward Adaptation for Robust Preference Modeling
di: Sun, Zhenyu, et al.
Pubblicazione: (2026)
di: Sun, Zhenyu, et al.
Pubblicazione: (2026)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
di: Ahmad, Ahmad, et al.
Pubblicazione: (2024)
di: Ahmad, Ahmad, et al.
Pubblicazione: (2024)
Scaling On-Device GPU Inference for Large Generative Models
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
di: Ma, Rachel, et al.
Pubblicazione: (2026)
di: Ma, Rachel, et al.
Pubblicazione: (2026)
Value of Information and Reward Specification in Active Inference and POMDPs
di: Wei, Ran
Pubblicazione: (2024)
di: Wei, Ran
Pubblicazione: (2024)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
di: Kim, Kwanyoung, et al.
Pubblicazione: (2026)
di: Kim, Kwanyoung, et al.
Pubblicazione: (2026)
Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
di: Xing, Jingyu, et al.
Pubblicazione: (2025)
di: Xing, Jingyu, et al.
Pubblicazione: (2025)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
di: Deng, Yongxin, et al.
Pubblicazione: (2024)
di: Deng, Yongxin, et al.
Pubblicazione: (2024)
Diffusion-Reward Adversarial Imitation Learning
di: Lai, Chun-Mao, et al.
Pubblicazione: (2024)
di: Lai, Chun-Mao, et al.
Pubblicazione: (2024)
SemiReward: A General Reward Model for Semi-supervised Learning
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning
di: Zabounidis, Renos, et al.
Pubblicazione: (2025)
di: Zabounidis, Renos, et al.
Pubblicazione: (2025)
An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination
di: Wei, Dixiao, et al.
Pubblicazione: (2025)
di: Wei, Dixiao, et al.
Pubblicazione: (2025)
Inference-Time Scaling for Generalist Reward Modeling
di: Liu, Zijun, et al.
Pubblicazione: (2025)
di: Liu, Zijun, et al.
Pubblicazione: (2025)
Large Language Models to Diffusion Finetuning
di: Cetin, Edoardo, et al.
Pubblicazione: (2025)
di: Cetin, Edoardo, et al.
Pubblicazione: (2025)
MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
di: Luo, Tianyang, et al.
Pubblicazione: (2026)
di: Luo, Tianyang, et al.
Pubblicazione: (2026)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
di: Zhang, Chen Bo Calvin, et al.
Pubblicazione: (2024)
Policy Filtration for RLHF to Mitigate Noise in Reward Models
di: Zhang, Chuheng, et al.
Pubblicazione: (2024)
di: Zhang, Chuheng, et al.
Pubblicazione: (2024)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
di: Patel, Nirmal, et al.
Pubblicazione: (2026)
di: Patel, Nirmal, et al.
Pubblicazione: (2026)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
di: Kim, Yoonjeon, et al.
Pubblicazione: (2025)
di: Kim, Yoonjeon, et al.
Pubblicazione: (2025)
Automatically Finding Reward Model Biases
di: Wang, Atticus, et al.
Pubblicazione: (2026)
di: Wang, Atticus, et al.
Pubblicazione: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
di: Jiang, Zaifan, et al.
Pubblicazione: (2023)
di: Jiang, Zaifan, et al.
Pubblicazione: (2023)
Intra-Trajectory Consistency for Reward Modeling
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
di: Zhou, Chaoyang, et al.
Pubblicazione: (2025)
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
di: Beigi, Mohammad, et al.
Pubblicazione: (2026)
di: Beigi, Mohammad, et al.
Pubblicazione: (2026)
Adversarial Training for Process Reward Models
di: Juneja, Gurusha, et al.
Pubblicazione: (2025)
di: Juneja, Gurusha, et al.
Pubblicazione: (2025)
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
di: He, Qianxi, et al.
Pubblicazione: (2025)
di: He, Qianxi, et al.
Pubblicazione: (2025)
Proximal Diffusion Neural Sampler
di: Guo, Wei, et al.
Pubblicazione: (2025)
di: Guo, Wei, et al.
Pubblicazione: (2025)
Fake it till You Make it: Reward Modeling as Discriminative Prediction
di: Liu, Runtao, et al.
Pubblicazione: (2025)
di: Liu, Runtao, et al.
Pubblicazione: (2025)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
di: Holmes, Ian, et al.
Pubblicazione: (2025)
di: Holmes, Ian, et al.
Pubblicazione: (2025)
Reward Hacking Mitigation using Verifiable Composite Rewards
di: Tarek, Mirza Farhan Bin, et al.
Pubblicazione: (2025)
di: Tarek, Mirza Farhan Bin, et al.
Pubblicazione: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
di: Cho, Minjae, et al.
Pubblicazione: (2026)
di: Cho, Minjae, et al.
Pubblicazione: (2026)
Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
di: Gumbsch, Christian, et al.
Pubblicazione: (2026)
di: Gumbsch, Christian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
di: Chen, Yang, et al.
Pubblicazione: (2025) -
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
di: Wang, Haozhe, et al.
Pubblicazione: (2026) -
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
di: Wang, Chaoqi, et al.
Pubblicazione: (2025) -
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
di: Kim, Yeongmin, et al.
Pubblicazione: (2026) -
RewardAnything: Generalizable Principle-Following Reward Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)