PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Deng, Fei, Wang, Qifei, Wei, Wei, Grundmann, Matthias, Hou, Tingbo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
von: Chen, Yang, et al.
Veröffentlicht: (2025)
von: Chen, Yang, et al.
Veröffentlicht: (2025)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
von: Kim, Yeongmin, et al.
Veröffentlicht: (2026)
von: Kim, Yeongmin, et al.
Veröffentlicht: (2026)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
In-Context Reward Adaptation for Robust Preference Modeling
von: Sun, Zhenyu, et al.
Veröffentlicht: (2026)
von: Sun, Zhenyu, et al.
Veröffentlicht: (2026)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
von: Ahmad, Ahmad, et al.
Veröffentlicht: (2024)
von: Ahmad, Ahmad, et al.
Veröffentlicht: (2024)
Scaling On-Device GPU Inference for Large Generative Models
von: Tang, Jiuqiang, et al.
Veröffentlicht: (2025)
von: Tang, Jiuqiang, et al.
Veröffentlicht: (2025)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
von: Ma, Rachel, et al.
Veröffentlicht: (2026)
von: Ma, Rachel, et al.
Veröffentlicht: (2026)
Value of Information and Reward Specification in Active Inference and POMDPs
von: Wei, Ran
Veröffentlicht: (2024)
von: Wei, Ran
Veröffentlicht: (2024)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
von: Kim, Kwanyoung, et al.
Veröffentlicht: (2026)
von: Kim, Kwanyoung, et al.
Veröffentlicht: (2026)
Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
von: Xing, Jingyu, et al.
Veröffentlicht: (2025)
von: Xing, Jingyu, et al.
Veröffentlicht: (2025)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
von: Deng, Yongxin, et al.
Veröffentlicht: (2024)
von: Deng, Yongxin, et al.
Veröffentlicht: (2024)
Diffusion-Reward Adversarial Imitation Learning
von: Lai, Chun-Mao, et al.
Veröffentlicht: (2024)
von: Lai, Chun-Mao, et al.
Veröffentlicht: (2024)
SemiReward: A General Reward Model for Semi-supervised Learning
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning
von: Zabounidis, Renos, et al.
Veröffentlicht: (2025)
von: Zabounidis, Renos, et al.
Veröffentlicht: (2025)
An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination
von: Wei, Dixiao, et al.
Veröffentlicht: (2025)
von: Wei, Dixiao, et al.
Veröffentlicht: (2025)
Inference-Time Scaling for Generalist Reward Modeling
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
Large Language Models to Diffusion Finetuning
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)
MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
von: Luo, Tianyang, et al.
Veröffentlicht: (2026)
von: Luo, Tianyang, et al.
Veröffentlicht: (2026)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
von: Zhang, Chen Bo Calvin, et al.
Veröffentlicht: (2024)
von: Zhang, Chen Bo Calvin, et al.
Veröffentlicht: (2024)
Policy Filtration for RLHF to Mitigate Noise in Reward Models
von: Zhang, Chuheng, et al.
Veröffentlicht: (2024)
von: Zhang, Chuheng, et al.
Veröffentlicht: (2024)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
von: Patel, Nirmal, et al.
Veröffentlicht: (2026)
von: Patel, Nirmal, et al.
Veröffentlicht: (2026)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
von: Mao, Yixiu, et al.
Veröffentlicht: (2026)
von: Mao, Yixiu, et al.
Veröffentlicht: (2026)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026)
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
von: Kim, Yoonjeon, et al.
Veröffentlicht: (2025)
von: Kim, Yoonjeon, et al.
Veröffentlicht: (2025)
Automatically Finding Reward Model Biases
von: Wang, Atticus, et al.
Veröffentlicht: (2026)
von: Wang, Atticus, et al.
Veröffentlicht: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
von: Jiang, Zaifan, et al.
Veröffentlicht: (2023)
von: Jiang, Zaifan, et al.
Veröffentlicht: (2023)
Intra-Trajectory Consistency for Reward Modeling
von: Zhou, Chaoyang, et al.
Veröffentlicht: (2025)
von: Zhou, Chaoyang, et al.
Veröffentlicht: (2025)
Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking
von: Beigi, Mohammad, et al.
Veröffentlicht: (2026)
von: Beigi, Mohammad, et al.
Veröffentlicht: (2026)
Adversarial Training for Process Reward Models
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
von: Juneja, Gurusha, et al.
Veröffentlicht: (2025)
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
von: He, Qianxi, et al.
Veröffentlicht: (2025)
von: He, Qianxi, et al.
Veröffentlicht: (2025)
Proximal Diffusion Neural Sampler
von: Guo, Wei, et al.
Veröffentlicht: (2025)
von: Guo, Wei, et al.
Veröffentlicht: (2025)
Fake it till You Make it: Reward Modeling as Discriminative Prediction
von: Liu, Runtao, et al.
Veröffentlicht: (2025)
von: Liu, Runtao, et al.
Veröffentlicht: (2025)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
von: Holmes, Ian, et al.
Veröffentlicht: (2025)
von: Holmes, Ian, et al.
Veröffentlicht: (2025)
Reward Hacking Mitigation using Verifiable Composite Rewards
von: Tarek, Mirza Farhan Bin, et al.
Veröffentlicht: (2025)
von: Tarek, Mirza Farhan Bin, et al.
Veröffentlicht: (2025)
Repairing Reward Functions with Feedback to Mitigate Reward Hacking
von: Hatgis-Kessell, Stephane, et al.
Veröffentlicht: (2025)
von: Hatgis-Kessell, Stephane, et al.
Veröffentlicht: (2025)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
von: Cho, Minjae, et al.
Veröffentlicht: (2026)
von: Cho, Minjae, et al.
Veröffentlicht: (2026)
Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained Models
von: Chijiwa, Daiki, et al.
Veröffentlicht: (2025)
von: Chijiwa, Daiki, et al.
Veröffentlicht: (2025)
From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models
von: Gumbsch, Christian, et al.
Veröffentlicht: (2026)
von: Gumbsch, Christian, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
von: Chen, Yang, et al.
Veröffentlicht: (2025) -
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
von: Wang, Haozhe, et al.
Veröffentlicht: (2026) -
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025) -
Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models
von: Kim, Yeongmin, et al.
Veröffentlicht: (2026) -
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)