Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
Fuente:
arXiv
Salvato in:
| Autori principali: | Kang, Hyeongyu, Lee, Jaewoo, Shin, Woocheol, Om, Kiyoung, Park, Jinkyoo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automated Kernel Discovery Towards Understanding High-dimensional Bayesian Optimization
di: Yun, Taeyoung, et al.
Pubblicazione: (2026)
di: Yun, Taeyoung, et al.
Pubblicazione: (2026)
Diffusion Alignment as Variational Expectation-Maximization
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
Posterior Inference in Latent Space for Scalable Constrained Black-box Optimization
di: Om, Kiyoung, et al.
Pubblicazione: (2025)
di: Om, Kiyoung, et al.
Pubblicazione: (2025)
Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference
di: Lee, Jaewoo, et al.
Pubblicazione: (2026)
di: Lee, Jaewoo, et al.
Pubblicazione: (2026)
Posterior Inference with Diffusion Models for High-dimensional Black-box Optimization
di: Yun, Taeyoung, et al.
Pubblicazione: (2025)
di: Yun, Taeyoung, et al.
Pubblicazione: (2025)
Guided Trajectory Generation with Diffusion Models for Offline Model-based Optimization
di: Yun, Taeyoung, et al.
Pubblicazione: (2024)
di: Yun, Taeyoung, et al.
Pubblicazione: (2024)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
di: Song, Chihyeon, et al.
Pubblicazione: (2025)
di: Song, Chihyeon, et al.
Pubblicazione: (2025)
GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm
di: Kim, Hyeonjun, et al.
Pubblicazione: (2025)
di: Kim, Hyeonjun, et al.
Pubblicazione: (2025)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
di: Zekri, Oussama, et al.
Pubblicazione: (2025)
di: Zekri, Oussama, et al.
Pubblicazione: (2025)
Reparameterization Proximal Policy Optimization
di: Zhong, Hai, et al.
Pubblicazione: (2025)
di: Zhong, Hai, et al.
Pubblicazione: (2025)
Reparameterization Flow Policy Optimization
di: Zhong, Hai, et al.
Pubblicazione: (2026)
di: Zhong, Hai, et al.
Pubblicazione: (2026)
Subgraph-level Universal Prompt Tuning
di: Lee, Junhyun, et al.
Pubblicazione: (2024)
di: Lee, Junhyun, et al.
Pubblicazione: (2024)
Soft Deterministic Policy Gradient with Gaussian Smoothing
di: Na, Hyunjun, et al.
Pubblicazione: (2026)
di: Na, Hyunjun, et al.
Pubblicazione: (2026)
Soft Actor-Critic with Beta Policy via Implicit Reparameterization Gradients
di: Della Libera, Luca
Pubblicazione: (2024)
di: Della Libera, Luca
Pubblicazione: (2024)
Policy Gradient with Adaptive Entropy Annealing for Continual Fine-Tuning
di: Zhang, Yaqian, et al.
Pubblicazione: (2026)
di: Zhang, Yaqian, et al.
Pubblicazione: (2026)
Quantum-Inspired Fine-Tuning for Few-Shot AIGC Detection via Phase-Structured Reparameterization
di: Xing, Kaiyang, et al.
Pubblicazione: (2026)
di: Xing, Kaiyang, et al.
Pubblicazione: (2026)
Tracing Mathematical Proficiency Through Problem-Solving Processes
di: Park, Jungyang, et al.
Pubblicazione: (2025)
di: Park, Jungyang, et al.
Pubblicazione: (2025)
Ensembling Prioritized Hybrid Policies for Multi-agent Pathfinding
di: Tang, Huijie, et al.
Pubblicazione: (2024)
di: Tang, Huijie, et al.
Pubblicazione: (2024)
Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
di: Lee, Jeong Woon, et al.
Pubblicazione: (2026)
di: Lee, Jeong Woon, et al.
Pubblicazione: (2026)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
di: Hong, Joey, et al.
Pubblicazione: (2024)
di: Hong, Joey, et al.
Pubblicazione: (2024)
Multimodal Crystal Flow: Any-to-Any Modality Generation for Unified Crystal Modeling
di: Seong, Kiyoung, et al.
Pubblicazione: (2026)
di: Seong, Kiyoung, et al.
Pubblicazione: (2026)
Bayesian Natural Gradient Fine-Tuning of CLIP Models via Kalman Filtering
di: Abdi, Hossein, et al.
Pubblicazione: (2025)
di: Abdi, Hossein, et al.
Pubblicazione: (2025)
Fine-Tuning Diffusion Models via Intermediate Distribution Shaping
di: Anil, Gautham Govind, et al.
Pubblicazione: (2025)
di: Anil, Gautham Govind, et al.
Pubblicazione: (2025)
PG-Rainbow: Using Distributional Reinforcement Learning in Policy Gradient Methods
di: Jeon, WooJae, et al.
Pubblicazione: (2024)
di: Jeon, WooJae, et al.
Pubblicazione: (2024)
CoTox: Chain-of-Thought-Based Molecular Toxicity Reasoning and Prediction
di: Park, Jueon, et al.
Pubblicazione: (2025)
di: Park, Jueon, et al.
Pubblicazione: (2025)
CLoQ: Enhancing Fine-Tuning of Quantized LLMs via Calibrated LoRA Initialization
di: Deng, Yanxia, et al.
Pubblicazione: (2025)
di: Deng, Yanxia, et al.
Pubblicazione: (2025)
Learning Strategy Representation for Imitation Learning in Multi-Agent Games
di: Lei, Shiqi, et al.
Pubblicazione: (2024)
di: Lei, Shiqi, et al.
Pubblicazione: (2024)
Rethinking the Rank Threshold for LoRA Fine-Tuning
di: Park, Juneyoung
Pubblicazione: (2026)
di: Park, Juneyoung
Pubblicazione: (2026)
Distributional Soft Actor-Critic with Diffusion Policy
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Direct Soft-Policy Sampling via Langevin Dynamics
di: Ki, Donghyeon, et al.
Pubblicazione: (2026)
di: Ki, Donghyeon, et al.
Pubblicazione: (2026)
Localized LoRA: A Structured Low-Rank Approximation for Efficient Fine-Tuning
di: Barazandeh, Babak, et al.
Pubblicazione: (2025)
di: Barazandeh, Babak, et al.
Pubblicazione: (2025)
Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
Active Attacks: Red-teaming LLMs via Adaptive Environments
di: Yun, Taeyoung, et al.
Pubblicazione: (2025)
di: Yun, Taeyoung, et al.
Pubblicazione: (2025)
Adaptive Action Chunking via Multi-Chunk Q Value Estimation
di: Shin, Yongjae, et al.
Pubblicazione: (2026)
di: Shin, Yongjae, et al.
Pubblicazione: (2026)
Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control
di: Uehara, Masatoshi, et al.
Pubblicazione: (2024)
di: Uehara, Masatoshi, et al.
Pubblicazione: (2024)
Adaptive Policy Backbone via Shared Network
di: Park, Bumgeun, et al.
Pubblicazione: (2025)
di: Park, Bumgeun, et al.
Pubblicazione: (2025)
Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives
di: Lee, Taeho, et al.
Pubblicazione: (2026)
di: Lee, Taeho, et al.
Pubblicazione: (2026)
Learning a Diffusion Model Policy from Rewards via Q-Score Matching
di: Psenka, Michael, et al.
Pubblicazione: (2023)
di: Psenka, Michael, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Automated Kernel Discovery Towards Understanding High-dimensional Bayesian Optimization
di: Yun, Taeyoung, et al.
Pubblicazione: (2026) -
Diffusion Alignment as Variational Expectation-Maximization
di: Lee, Jaewoo, et al.
Pubblicazione: (2025) -
Posterior Inference in Latent Space for Scalable Constrained Black-box Optimization
di: Om, Kiyoung, et al.
Pubblicazione: (2025) -
Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference
di: Lee, Jaewoo, et al.
Pubblicazione: (2026) -
Posterior Inference with Diffusion Models for High-dimensional Black-box Optimization
di: Yun, Taeyoung, et al.
Pubblicazione: (2025)