Scores as Actions: a framework of fine-tuning diffusion models by continuous-time reinforcement learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Hanyang, Chen, Haoxian, Zhang, Ji, Yao, David D., Tang, Wenpin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Score as Action: Fine-Tuning Diffusion Generative Models by Continuous-time Reinforcement Learning
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
di: Chen, Haoxian, et al.
Pubblicazione: (2024)
di: Chen, Haoxian, et al.
Pubblicazione: (2024)
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
di: Sheng, Jiayuan, et al.
Pubblicazione: (2025)
di: Sheng, Jiayuan, et al.
Pubblicazione: (2025)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
di: Zhao, Hanyang, et al.
Pubblicazione: (2026)
di: Zhao, Hanyang, et al.
Pubblicazione: (2026)
RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
Improved techniques for fine-tuning flow models via adjoint matching: a deterministic control pipeline
di: Guo, Zhengyi, et al.
Pubblicazione: (2026)
di: Guo, Zhengyi, et al.
Pubblicazione: (2026)
Score-based Diffusion Models via Stochastic Differential Equations -- a Technical Tutorial
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
Diffusion Generative Models Meet Compressed Sensing, with Applications to Imaging and Finance
di: Guo, Zhengyi, et al.
Pubblicazione: (2025)
di: Guo, Zhengyi, et al.
Pubblicazione: (2025)
Learning from models beyond fine-tuning
di: Zheng, Hongling, et al.
Pubblicazione: (2023)
di: Zheng, Hongling, et al.
Pubblicazione: (2023)
Maximum diffusion reinforcement learning
di: Berrueta, Thomas A., et al.
Pubblicazione: (2023)
di: Berrueta, Thomas A., et al.
Pubblicazione: (2023)
Causal prompting model-based offline reinforcement learning
di: Yu, Xuehui, et al.
Pubblicazione: (2024)
di: Yu, Xuehui, et al.
Pubblicazione: (2024)
Contractive Diffusion Probabilistic Models
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
Evolutionary fine tuning of quantized convolution-based deep learning models
di: Pietroń, Marcin
Pubblicazione: (2026)
di: Pietroń, Marcin
Pubblicazione: (2026)
Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
Fine-tuning of diffusion models via stochastic control: entropy regularization and beyond
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization
di: Zhao, Hanyang, et al.
Pubblicazione: (2024)
di: Zhao, Hanyang, et al.
Pubblicazione: (2024)
Dynamic feature selection in medical predictive monitoring by reinforcement learning
di: Chen, Yutong, et al.
Pubblicazione: (2024)
di: Chen, Yutong, et al.
Pubblicazione: (2024)
Task diversity produces systematic transfer but inhibits continual reinforcement learning
di: Seth, Purab, et al.
Pubblicazione: (2026)
di: Seth, Purab, et al.
Pubblicazione: (2026)
Scilab-RL: A software framework for efficient reinforcement learning and cognitive modeling research
di: Dohmen, Jan, et al.
Pubblicazione: (2024)
di: Dohmen, Jan, et al.
Pubblicazione: (2024)
SOCRATES: Simulation Optimization with Correlated Replicas and Adaptive Trajectory Evaluations
di: Zhang, Haoting, et al.
Pubblicazione: (2025)
di: Zhang, Haoting, et al.
Pubblicazione: (2025)
Avoiding mode collapse in diffusion models fine-tuned with reinforcement learning
di: Barceló, Roberto, et al.
Pubblicazione: (2024)
di: Barceló, Roberto, et al.
Pubblicazione: (2024)
Deep reinforcement learning for weakly coupled MDP's with continuous actions
di: Robledo, Francisco, et al.
Pubblicazione: (2024)
di: Robledo, Francisco, et al.
Pubblicazione: (2024)
Uncertainty modeling for fine-tuned implicit functions
di: Susmelj, Anna, et al.
Pubblicazione: (2024)
di: Susmelj, Anna, et al.
Pubblicazione: (2024)
Rethinking harmless refusals when fine-tuning foundation models
di: Pop, Florin, et al.
Pubblicazione: (2024)
di: Pop, Florin, et al.
Pubblicazione: (2024)
FastODT: A tree-based framework for efficient continual learning
di: Bretsko, Daniel, et al.
Pubblicazione: (2026)
di: Bretsko, Daniel, et al.
Pubblicazione: (2026)
Overcoming systematic softening in universal machine learning interatomic potentials by fine-tuning
di: Deng, Bowen, et al.
Pubblicazione: (2024)
di: Deng, Bowen, et al.
Pubblicazione: (2024)
Deep reinforcement learning with time-scale invariant memory
di: Kabir, Md Rysul, et al.
Pubblicazione: (2024)
di: Kabir, Md Rysul, et al.
Pubblicazione: (2024)
TemporalPaD: a reinforcement-learning framework for temporal feature representation and dimension reduction
di: Mu, Xuechen, et al.
Pubblicazione: (2024)
di: Mu, Xuechen, et al.
Pubblicazione: (2024)
Found-RL: foundation model-enhanced reinforcement learning for autonomous driving
di: Qu, Yansong, et al.
Pubblicazione: (2026)
di: Qu, Yansong, et al.
Pubblicazione: (2026)
Application of linear regression and quasi-Newton methods to the deep reinforcement learning in continuous action cases
di: Komatsu, Hisato
Pubblicazione: (2025)
di: Komatsu, Hisato
Pubblicazione: (2025)
Empirical influence functions to understand the logic of fine-tuning
di: Matelsky, Jordan K., et al.
Pubblicazione: (2024)
di: Matelsky, Jordan K., et al.
Pubblicazione: (2024)
A theoretical framework for self-supervised contrastive learning for continuous dependent data
di: Marusov, Alexander, et al.
Pubblicazione: (2025)
di: Marusov, Alexander, et al.
Pubblicazione: (2025)
Optimization of geological carbon storage operations with multimodal latent dynamic model and deep reinforcement learning
di: Wang, Zhongzheng, et al.
Pubblicazione: (2024)
di: Wang, Zhongzheng, et al.
Pubblicazione: (2024)
Efficient and Private: Memorisation under differentially private parameter-efficient fine-tuning in language models
di: Ma, Olivia, et al.
Pubblicazione: (2024)
di: Ma, Olivia, et al.
Pubblicazione: (2024)
Open-weight genome language model safeguards: Assessing robustness via adversarial fine-tuning
di: Black, James R. M., et al.
Pubblicazione: (2025)
di: Black, James R. M., et al.
Pubblicazione: (2025)
Jal Anveshak: Prediction of fishing zones using fine-tuned LlaMa 2
di: Mejari, Arnav, et al.
Pubblicazione: (2024)
di: Mejari, Arnav, et al.
Pubblicazione: (2024)
ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule
di: Huang, Yilie, et al.
Pubblicazione: (2026)
di: Huang, Yilie, et al.
Pubblicazione: (2026)
LaTiM: Longitudinal representation learning in continuous-time models to predict disease progression
di: Zeghlache, Rachid, et al.
Pubblicazione: (2024)
di: Zeghlache, Rachid, et al.
Pubblicazione: (2024)
LIFT: Interpretable truck driving risk prediction with literature-informed fine-tuned LLMs
di: Hu, Xiao, et al.
Pubblicazione: (2025)
di: Hu, Xiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Score as Action: Fine-Tuning Diffusion Generative Models by Continuous-time Reinforcement Learning
di: Zhao, Hanyang, et al.
Pubblicazione: (2025) -
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
di: Chen, Haoxian, et al.
Pubblicazione: (2024) -
Understanding Sampler Stochasticity in Training Diffusion Models for RLHF
di: Sheng, Jiayuan, et al.
Pubblicazione: (2025) -
OPD+: Rethinking the Advantage Design for On-Policy Distillation
di: Zhao, Hanyang, et al.
Pubblicazione: (2026) -
RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)