Score as Action: Fine-Tuning Diffusion Generative Models by Continuous-time Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Hanyang, Chen, Haoxian, Zhang, Ji, Yao, David D., Tang, Wenpin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
von: Sheng, Jiayuan, et al.
Veröffentlicht: (2025)
von: Sheng, Jiayuan, et al.
Veröffentlicht: (2025)
Scores as Actions: a framework of fine-tuning diffusion models by continuous-time reinforcement learning
von: Zhao, Hanyang, et al.
Veröffentlicht: (2024)
von: Zhao, Hanyang, et al.
Veröffentlicht: (2024)
ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule
von: Huang, Yilie, et al.
Veröffentlicht: (2026)
von: Huang, Yilie, et al.
Veröffentlicht: (2026)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
von: Chen, Haoxian, et al.
Veröffentlicht: (2024)
von: Chen, Haoxian, et al.
Veröffentlicht: (2024)
RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)
Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning
von: Ding, Jianglin, et al.
Veröffentlicht: (2025)
von: Ding, Jianglin, et al.
Veröffentlicht: (2025)
Reward-Directed Score-Based Diffusion Models via q-Learning
von: Gao, Xuefeng, et al.
Veröffentlicht: (2024)
von: Gao, Xuefeng, et al.
Veröffentlicht: (2024)
Safe Control and Learning Using Generalized Action Governor
von: Fang, Peiyuan, et al.
Veröffentlicht: (2022)
von: Fang, Peiyuan, et al.
Veröffentlicht: (2022)
Using Laplace Transform To Optimize the Hallucination of Generation Models
von: Kang, Cheng, et al.
Veröffentlicht: (2026)
von: Kang, Cheng, et al.
Veröffentlicht: (2026)
Deep Reinforcement Learning for Flexible Job Shop Scheduling with Random Job Arrivals
von: Tang, Yu, et al.
Veröffentlicht: (2026)
von: Tang, Yu, et al.
Veröffentlicht: (2026)
Deep Reinforcement Learning for Multi-Objective Optimization: Enhancing Wind Turbine Energy Generation while Mitigating Noise Emissions
von: de Frutos, Martín, et al.
Veröffentlicht: (2024)
von: de Frutos, Martín, et al.
Veröffentlicht: (2024)
OR-R1: Automating Modeling and Solving of Operations Research Optimization Problem via Test-Time Reinforcement Learning
von: Ding, Zezhen, et al.
Veröffentlicht: (2025)
von: Ding, Zezhen, et al.
Veröffentlicht: (2025)
A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety
von: Li, Gang, et al.
Veröffentlicht: (2024)
von: Li, Gang, et al.
Veröffentlicht: (2024)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)
Learning to Cut: Reinforcement Learning for Benders Decomposition
von: Cai, Haochen, et al.
Veröffentlicht: (2026)
von: Cai, Haochen, et al.
Veröffentlicht: (2026)
Accelerating Convergence of Score-Based Diffusion Models, Provably
von: Li, Gen, et al.
Veröffentlicht: (2024)
von: Li, Gen, et al.
Veröffentlicht: (2024)
Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and State
von: Cheng, Ziheng, et al.
Veröffentlicht: (2025)
von: Cheng, Ziheng, et al.
Veröffentlicht: (2025)
Deep Reinforcement Learning Optimization for Uncertain Nonlinear Systems via Event-Triggered Robust Adaptive Dynamic Programming
von: Bai, Ningwei, et al.
Veröffentlicht: (2025)
von: Bai, Ningwei, et al.
Veröffentlicht: (2025)
Fine-tuning of diffusion models via stochastic control: entropy regularization and beyond
von: Tang, Wenpin, et al.
Veröffentlicht: (2024)
von: Tang, Wenpin, et al.
Veröffentlicht: (2024)
Model Predictive Control and Reinforcement Learning: A Unified Framework Based on Dynamic Programming
von: Bertsekas, Dimitri P.
Veröffentlicht: (2024)
von: Bertsekas, Dimitri P.
Veröffentlicht: (2024)
Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems
von: Huang, Yilie, et al.
Veröffentlicht: (2024)
von: Huang, Yilie, et al.
Veröffentlicht: (2024)
A Method to Improve the Performance of Reinforcement Learning Based on the Y Operator for a Class of Stochastic Differential Equation-Based Child-Mother Systems
von: Yin, Cheng, et al.
Veröffentlicht: (2023)
von: Yin, Cheng, et al.
Veröffentlicht: (2023)
Continuous Q-Score Matching: Diffusion Guided Reinforcement Learning for Continuous-Time Control
von: Hua, Chengxiu, et al.
Veröffentlicht: (2025)
von: Hua, Chengxiu, et al.
Veröffentlicht: (2025)
New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework
von: Ma, Shaocong, et al.
Veröffentlicht: (2026)
von: Ma, Shaocong, et al.
Veröffentlicht: (2026)
Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective
von: Fernando, Heshan, et al.
Veröffentlicht: (2024)
von: Fernando, Heshan, et al.
Veröffentlicht: (2024)
Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems
von: Huang, Yilie, et al.
Veröffentlicht: (2025)
von: Huang, Yilie, et al.
Veröffentlicht: (2025)
Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models
von: Gautam, Tanmay, et al.
Veröffentlicht: (2024)
von: Gautam, Tanmay, et al.
Veröffentlicht: (2024)
Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients
von: Alvo, Matias, et al.
Veröffentlicht: (2026)
von: Alvo, Matias, et al.
Veröffentlicht: (2026)
Safety-Aware Reinforcement Learning for Electric Vehicle Charging Station Management in Distribution Network
von: Fan, Jiarong, et al.
Veröffentlicht: (2024)
von: Fan, Jiarong, et al.
Veröffentlicht: (2024)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
von: Zhao, Hanyang, et al.
Veröffentlicht: (2026)
von: Zhao, Hanyang, et al.
Veröffentlicht: (2026)
Continuous-Time Reinforcement Learning for Asset-Liability Management
von: Huang, Yilie
Veröffentlicht: (2025)
von: Huang, Yilie
Veröffentlicht: (2025)
Quantum-Inspired Multi Agent Reinforcement Learning for Exploration Exploitation Optimization in UAV-Assisted 6G Network Deployment
von: Taghavi, Mazyar, et al.
Veröffentlicht: (2025)
von: Taghavi, Mazyar, et al.
Veröffentlicht: (2025)
Adaptive Stabilization Based on Machine Learning for Column Generation
von: Shen, Yunzhuang, et al.
Veröffentlicht: (2024)
von: Shen, Yunzhuang, et al.
Veröffentlicht: (2024)
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
von: Pan, Rui, et al.
Veröffentlicht: (2024)
von: Pan, Rui, et al.
Veröffentlicht: (2024)
Deep Reinforcement Learning for Traveling Purchaser Problems
von: Yuan, Haofeng, et al.
Veröffentlicht: (2024)
von: Yuan, Haofeng, et al.
Veröffentlicht: (2024)
Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems with Known Optimal Policies
von: Ibrahim, Sinan, et al.
Veröffentlicht: (2026)
von: Ibrahim, Sinan, et al.
Veröffentlicht: (2026)
Agent-Based Decentralized Energy Management of EV Charging Station with Solar Photovoltaics via Multi-Agent Reinforcement Learning
von: Fan, Jiarong, et al.
Veröffentlicht: (2025)
von: Fan, Jiarong, et al.
Veröffentlicht: (2025)
Safe Decentralized Operation of EV Virtual Power Plant with Limited Network Visibility via Multi-Agent Reinforcement Learning
von: Huang, Chenghao, et al.
Veröffentlicht: (2026)
von: Huang, Chenghao, et al.
Veröffentlicht: (2026)
Decoupled Continuous-Time Reinforcement Learning via Hamiltonian Flow
von: Nguyen, Minh
Veröffentlicht: (2026)
von: Nguyen, Minh
Veröffentlicht: (2026)
Adaptive Primal-Dual Method for Safe Reinforcement Learning
von: Chen, Weiqin, et al.
Veröffentlicht: (2024)
von: Chen, Weiqin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
von: Sheng, Jiayuan, et al.
Veröffentlicht: (2025) -
Scores as Actions: a framework of fine-tuning diffusion models by continuous-time reinforcement learning
von: Zhao, Hanyang, et al.
Veröffentlicht: (2024) -
ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule
von: Huang, Yilie, et al.
Veröffentlicht: (2026) -
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
von: Chen, Haoxian, et al.
Veröffentlicht: (2024) -
RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)