SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yixian, Yu, Shu'ang, Zhang, Tonghe, Guang, Mo, Hui, Haojia, Long, Kaiwen, Wang, Yu, Yu, Chao, Ding, Wenbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
di: Zhang, Tonghe, et al.
Pubblicazione: (2025)
di: Zhang, Tonghe, et al.
Pubblicazione: (2025)
Reparameterization Flow Policy Optimization
di: Zhong, Hai, et al.
Pubblicazione: (2026)
di: Zhong, Hai, et al.
Pubblicazione: (2026)
Policy Newton Algorithm in Reproducing Kernel Hilbert Space
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
Provably Efficient Partially Observable Risk-Sensitive Reinforcement Learning with Hindsight Observation
di: Zhang, Tonghe, et al.
Pubblicazione: (2024)
di: Zhang, Tonghe, et al.
Pubblicazione: (2024)
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
di: Cao, Xiaoyang, et al.
Pubblicazione: (2025)
di: Cao, Xiaoyang, et al.
Pubblicazione: (2025)
Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
Power Spectra of Velocity Fluctuations in Granular Heap Flow
di: Yu, ShuChang, et al.
Pubblicazione: (2025)
di: Yu, ShuChang, et al.
Pubblicazione: (2025)
SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
di: Zhao, Yanxiao, et al.
Pubblicazione: (2025)
di: Zhao, Yanxiao, et al.
Pubblicazione: (2025)
Never Saddle for Reparameterized Steepest Descent as Mirror Flow
di: Jacobs, Tom, et al.
Pubblicazione: (2026)
di: Jacobs, Tom, et al.
Pubblicazione: (2026)
FAVE: Flow-based Average Velocity Establishment for Sequential Recommendation
di: Shi, Ke, et al.
Pubblicazione: (2026)
di: Shi, Ke, et al.
Pubblicazione: (2026)
Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching
di: Wang, Feng, et al.
Pubblicazione: (2025)
di: Wang, Feng, et al.
Pubblicazione: (2025)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
di: Yuan, Huining, et al.
Pubblicazione: (2025)
di: Yuan, Huining, et al.
Pubblicazione: (2025)
Localization matters too: How localization error affects UAV flight
di: Zhang, Suquan, et al.
Pubblicazione: (2024)
di: Zhang, Suquan, et al.
Pubblicazione: (2024)
Functional Gradient Flows for Constrained Sampling
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
Reinforcement Learning via Value Gradient Flow
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
What Matters in Learning A Zero-Shot Sim-to-Real RL Policy for Quadrotor Control? A Comprehensive Study
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
di: Chen, Jiayu, et al.
Pubblicazione: (2024)
Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling
di: Ma, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ma, Zhiyuan, et al.
Pubblicazione: (2025)
Flow-Based Policy for Online Reinforcement Learning
di: Lv, Lei, et al.
Pubblicazione: (2025)
di: Lv, Lei, et al.
Pubblicazione: (2025)
Stable Velocity: A Variance Perspective on Flow Matching
di: Yang, Donglin, et al.
Pubblicazione: (2026)
di: Yang, Donglin, et al.
Pubblicazione: (2026)
JuggleRL: Mastering Ball Juggling with a Quadrotor via Deep Reinforcement Learning
di: Ji, Shilong, et al.
Pubblicazione: (2025)
di: Ji, Shilong, et al.
Pubblicazione: (2025)
Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
di: Lee, Kyungmin, et al.
Pubblicazione: (2025)
di: Lee, Kyungmin, et al.
Pubblicazione: (2025)
FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner
di: Zhao, Wenliang, et al.
Pubblicazione: (2024)
di: Zhao, Wenliang, et al.
Pubblicazione: (2024)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
di: Yu, Shu-Ang, et al.
Pubblicazione: (2025)
di: Yu, Shu-Ang, et al.
Pubblicazione: (2025)
Flow-OPD: On-Policy Distillation for Flow Matching Models
di: Fang, Zhen, et al.
Pubblicazione: (2026)
di: Fang, Zhen, et al.
Pubblicazione: (2026)
Consistency Flow Matching: Defining Straight Flows with Velocity Consistency
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Evolving Diffusion and Flow Matching Policies for Online Reinforcement Learning
di: Zhang, Chubin, et al.
Pubblicazione: (2025)
di: Zhang, Chubin, et al.
Pubblicazione: (2025)
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
di: Wan, Zhenglin, et al.
Pubblicazione: (2025)
di: Wan, Zhenglin, et al.
Pubblicazione: (2025)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
di: Chen, Kang, et al.
Pubblicazione: (2025)
di: Chen, Kang, et al.
Pubblicazione: (2025)
CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Neural BRDF Importance Sampling by Reparameterization
di: Wu, Liwen, et al.
Pubblicazione: (2025)
di: Wu, Liwen, et al.
Pubblicazione: (2025)
ProFlow: Zero-Shot Physics-Consistent Sampling via Proximal Flow Guidance
di: Yu, Zichao, et al.
Pubblicazione: (2026)
di: Yu, Zichao, et al.
Pubblicazione: (2026)
GauS: Differentiable Scheduling Optimization via Gaussian Reparameterization
di: Cai, Yaohui, et al.
Pubblicazione: (2026)
di: Cai, Yaohui, et al.
Pubblicazione: (2026)
Latent Action Reparameterization for Efficient Agent Inference
di: Huang, Wenhao, et al.
Pubblicazione: (2026)
di: Huang, Wenhao, et al.
Pubblicazione: (2026)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
ProbDiffFlow: An Efficient Learning-Free Framework for Probabilistic Single-Image Optical Flow Estimation
di: Zhou, Mo, et al.
Pubblicazione: (2025)
di: Zhou, Mo, et al.
Pubblicazione: (2025)
Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models
di: Yu, Benjamin, et al.
Pubblicazione: (2025)
di: Yu, Benjamin, et al.
Pubblicazione: (2025)
Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions
di: Kong, Lingkai, et al.
Pubblicazione: (2026)
di: Kong, Lingkai, et al.
Pubblicazione: (2026)
Reparameterization Proximal Policy Optimization
di: Zhong, Hai, et al.
Pubblicazione: (2025)
di: Zhong, Hai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
di: Zhang, Tonghe, et al.
Pubblicazione: (2025) -
Reparameterization Flow Policy Optimization
di: Zhong, Hai, et al.
Pubblicazione: (2026) -
Policy Newton Algorithm in Reproducing Kernel Hilbert Space
di: Zhang, Yixian, et al.
Pubblicazione: (2025) -
Provably Efficient Partially Observable Risk-Sensitive Reinforcement Learning with Hindsight Observation
di: Zhang, Tonghe, et al.
Pubblicazione: (2024) -
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
di: Cao, Xiaoyang, et al.
Pubblicazione: (2025)