Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Kai, Tao, Jian, Lyu, Jiafei, Ge, Chunjiang, Chen, Jiaxin, Li, Qimai, Shen, Weihan, Zhu, Xiaolong, Li, Xiu |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploration and Anti-Exploration with Distributional Random Network Distillation
by: Yang, Kai, et al.
Published: (2024)
by: Yang, Kai, et al.
Published: (2024)
A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning
by: Sun, Shengjie, et al.
Published: (2024)
by: Sun, Shengjie, et al.
Published: (2024)
Mind the Model, Not the Agent: The Primacy Bias in Model-based RL
by: Qiao, Zhongjian, et al.
Published: (2023)
by: Qiao, Zhongjian, et al.
Published: (2023)
Exploration by Random Distribution Distillation
by: Fang, Zhirui, et al.
Published: (2025)
by: Fang, Zhirui, et al.
Published: (2025)
Fine-tuning Flow Matching Generative Models with Intermediate Feedback
by: Fan, Jiajun, et al.
Published: (2025)
by: Fan, Jiajun, et al.
Published: (2025)
A Two-stage Reinforcement Learning-based Approach for Multi-entity Task Allocation
by: Gong, Aicheng, et al.
Published: (2024)
by: Gong, Aicheng, et al.
Published: (2024)
PEARL: Zero-shot Cross-task Preference Alignment and Robust Reward Learning for Robotic Manipulation
by: Liu, Runze, et al.
Published: (2023)
by: Liu, Runze, et al.
Published: (2023)
World Models with Hints of Large Language Models for Goal Achieving
by: Liu, Zeyuan, et al.
Published: (2024)
by: Liu, Zeyuan, et al.
Published: (2024)
Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models
by: Lee, Jeongjae, et al.
Published: (2026)
by: Lee, Jeongjae, et al.
Published: (2026)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
by: Zhao, Jian, et al.
Published: (2025)
by: Zhao, Jian, et al.
Published: (2025)
SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning
by: Qiao, Zhongjian, et al.
Published: (2024)
by: Qiao, Zhongjian, et al.
Published: (2024)
Novelty-Guided Data Reuse for Efficient and Diversified Multi-Agent Reinforcement Learning
by: Chen, Yangkun, et al.
Published: (2024)
by: Chen, Yangkun, et al.
Published: (2024)
Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
Mildly Conservative Q-Learning for Offline Reinforcement Learning
by: Lyu, Jiafei, et al.
Published: (2022)
by: Lyu, Jiafei, et al.
Published: (2022)
CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback
by: Ge, Wenhang, et al.
Published: (2026)
by: Ge, Wenhang, et al.
Published: (2026)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
by: Sun, Shengjie, et al.
Published: (2025)
by: Sun, Shengjie, et al.
Published: (2025)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
by: Yu, Zhang Ze, et al.
Published: (2023)
by: Yu, Zhang Ze, et al.
Published: (2023)
DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models
by: Chae, Daewon, et al.
Published: (2025)
by: Chae, Daewon, et al.
Published: (2025)
Scaling Reward Modeling without Human Supervision
by: Fan, Jingxuan, et al.
Published: (2026)
by: Fan, Jingxuan, et al.
Published: (2026)
PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
by: Yuan, Mingze, et al.
Published: (2025)
by: Yuan, Mingze, et al.
Published: (2025)
Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback
by: Chen, Jingyi, et al.
Published: (2025)
by: Chen, Jingyi, et al.
Published: (2025)
Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
by: Liao, Xinyao, et al.
Published: (2025)
by: Liao, Xinyao, et al.
Published: (2025)
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
by: Cai, Hongru, et al.
Published: (2026)
by: Cai, Hongru, et al.
Published: (2026)
Reward Modeling from Natural Language Human Feedback
by: Wang, Zongqi, et al.
Published: (2026)
by: Wang, Zongqi, et al.
Published: (2026)
Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks
by: Wu, Xiaoyu, et al.
Published: (2024)
by: Wu, Xiaoyu, et al.
Published: (2024)
Mechanism Design for LLM Fine-tuning with Multiple Reward Models
by: Sun, Haoran, et al.
Published: (2024)
by: Sun, Haoran, et al.
Published: (2024)
Efficient Adjoint Matching for Fine-tuning Diffusion Models
by: Shin, Jeongwoo, et al.
Published: (2026)
by: Shin, Jeongwoo, et al.
Published: (2026)
Cross-Domain Policy Adaptation by Capturing Representation Mismatch
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
Backdoor Cleaning without External Guidance in MLLM Fine-tuning
by: Rong, Xuankun, et al.
Published: (2025)
by: Rong, Xuankun, et al.
Published: (2025)
Realistic Human Motion Generation with Cross-Diffusion Models
by: Ren, Zeping, et al.
Published: (2023)
by: Ren, Zeping, et al.
Published: (2023)
Gen-Drive: Enhancing Diffusion Generative Driving Policies with Reward Modeling and Reinforcement Learning Fine-tuning
by: Huang, Zhiyu, et al.
Published: (2024)
by: Huang, Zhiyu, et al.
Published: (2024)
FedBiOT: LLM Local Fine-tuning in Federated Learning without Full Model
by: Wu, Feijie, et al.
Published: (2024)
by: Wu, Feijie, et al.
Published: (2024)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
Personalized Preference Fine-tuning of Diffusion Models
by: Dang, Meihua, et al.
Published: (2025)
by: Dang, Meihua, et al.
Published: (2025)
Iterative Importance Fine-tuning of Diffusion Models
by: Denker, Alexander, et al.
Published: (2025)
by: Denker, Alexander, et al.
Published: (2025)
Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
by: Kim, Kyuyoung, et al.
Published: (2024)
by: Kim, Kyuyoung, et al.
Published: (2024)
Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
by: Ma, Jian, et al.
Published: (2023)
by: Ma, Jian, et al.
Published: (2023)
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
by: Li, Shen, et al.
Published: (2024)
by: Li, Shen, et al.
Published: (2024)
LaFFi: Leveraging Hybrid Natural Language Feedback for Fine-tuning Language Models
by: Li, Qianxi, et al.
Published: (2023)
by: Li, Qianxi, et al.
Published: (2023)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
by: Wang, Yibo, et al.
Published: (2025)
by: Wang, Yibo, et al.
Published: (2025)
Similar Items
-
Exploration and Anti-Exploration with Distributional Random Network Distillation
by: Yang, Kai, et al.
Published: (2024) -
A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning
by: Sun, Shengjie, et al.
Published: (2024) -
Mind the Model, Not the Agent: The Primacy Bias in Model-based RL
by: Qiao, Zhongjian, et al.
Published: (2023) -
Exploration by Random Distribution Distillation
by: Fang, Zhirui, et al.
Published: (2025) -
Fine-tuning Flow Matching Generative Models with Intermediate Feedback
by: Fan, Jiajun, et al.
Published: (2025)