Flow-Based Policy for Online Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lv, Lei, Li, Yunfei, Luo, Yu, Sun, Fuchun, Kong, Tao, Xu, Jiafeng, Ma, Xiao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
von: Lv, Lei, et al.
Veröffentlicht: (2026)
von: Lv, Lei, et al.
Veröffentlicht: (2026)
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
von: Luo, Yu, et al.
Veröffentlicht: (2024)
von: Luo, Yu, et al.
Veröffentlicht: (2024)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
OMPO: A Unified Framework for RL under Policy and Dynamics Shifts
von: Luo, Yu, et al.
Veröffentlicht: (2024)
von: Luo, Yu, et al.
Veröffentlicht: (2024)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
von: Luo, Yu, et al.
Veröffentlicht: (2024)
von: Luo, Yu, et al.
Veröffentlicht: (2024)
Controllable Flow Matching for Online Reinforcement Learning
von: Wang, Bin, et al.
Veröffentlicht: (2025)
von: Wang, Bin, et al.
Veröffentlicht: (2025)
Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
von: Doo, JaeHyeok, et al.
Veröffentlicht: (2026)
von: Doo, JaeHyeok, et al.
Veröffentlicht: (2026)
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
von: Ji, Tianying, et al.
Veröffentlicht: (2023)
von: Ji, Tianying, et al.
Veröffentlicht: (2023)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies
von: Tayal, Mumuksh, et al.
Veröffentlicht: (2026)
von: Tayal, Mumuksh, et al.
Veröffentlicht: (2026)
Flow-based Policy With Distributional Reinforcement Learning in Trajectory Optimization
von: Hao, Ruijie, et al.
Veröffentlicht: (2026)
von: Hao, Ruijie, et al.
Veröffentlicht: (2026)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
Stackelberg Coupling of Online Representation Learning and Reinforcement Learning
von: Martinez, Fernando, et al.
Veröffentlicht: (2025)
von: Martinez, Fernando, et al.
Veröffentlicht: (2025)
Policy Gradient Methods for Risk-Sensitive Distributional Reinforcement Learning with Provable Convergence
von: Xiao, Minheng, et al.
Veröffentlicht: (2024)
von: Xiao, Minheng, et al.
Veröffentlicht: (2024)
Subequivariant Reinforcement Learning in 3D Multi-Entity Physical Environments
von: Chen, Runfa, et al.
Veröffentlicht: (2024)
von: Chen, Runfa, et al.
Veröffentlicht: (2024)
Discrete Flow Matching for Offline-to-Online Reinforcement Learning
von: Khan, Fairoz Nower, et al.
Veröffentlicht: (2026)
von: Khan, Fairoz Nower, et al.
Veröffentlicht: (2026)
LearningFlow: Automated Policy Learning Workflow for Urban Driving with Large Language Models
von: Peng, Zengqi, et al.
Veröffentlicht: (2025)
von: Peng, Zengqi, et al.
Veröffentlicht: (2025)
RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning
von: Xu, Charles, et al.
Veröffentlicht: (2024)
von: Xu, Charles, et al.
Veröffentlicht: (2024)
The Three Regimes of Offline-to-Online Reinforcement Learning
von: Li, Lu, et al.
Veröffentlicht: (2025)
von: Li, Lu, et al.
Veröffentlicht: (2025)
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
von: Shin, Yongjae, et al.
Veröffentlicht: (2026)
von: Shin, Yongjae, et al.
Veröffentlicht: (2026)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Towards Interpretable Reinforcement Learning with Constrained Normalizing Flow Policies
von: Rietz, Finn, et al.
Veröffentlicht: (2024)
von: Rietz, Finn, et al.
Veröffentlicht: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
von: Xie, Yaqi, et al.
Veröffentlicht: (2026)
von: Xie, Yaqi, et al.
Veröffentlicht: (2026)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
Towards Fast Safe Online Reinforcement Learning via Policy Finetuning
von: Chen, Keru, et al.
Veröffentlicht: (2024)
von: Chen, Keru, et al.
Veröffentlicht: (2024)
Decision Flow Policy Optimization
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning
von: Alles, Marvin, et al.
Veröffentlicht: (2025)
von: Alles, Marvin, et al.
Veröffentlicht: (2025)
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
von: Ji, Tianying, et al.
Veröffentlicht: (2024)
von: Ji, Tianying, et al.
Veröffentlicht: (2024)
Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data
von: Kong, Lingkai, et al.
Veröffentlicht: (2025)
von: Kong, Lingkai, et al.
Veröffentlicht: (2025)
Online Policy Distillation with Decision-Attention
von: Yu, Xinqiang, et al.
Veröffentlicht: (2024)
von: Yu, Xinqiang, et al.
Veröffentlicht: (2024)
CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Xiao, Xiaofeng, et al.
Veröffentlicht: (2026)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based Policies
von: Hu, Xixi, et al.
Veröffentlicht: (2024)
von: Hu, Xixi, et al.
Veröffentlicht: (2024)
Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
von: Tiofack, Franki Nguimatsia, et al.
Veröffentlicht: (2025)
von: Tiofack, Franki Nguimatsia, et al.
Veröffentlicht: (2025)
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
von: Kong, Yilun, et al.
Veröffentlicht: (2025)
von: Kong, Yilun, et al.
Veröffentlicht: (2025)
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
von: Ma, Hao, et al.
Veröffentlicht: (2026)
von: Ma, Hao, et al.
Veröffentlicht: (2026)
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
von: Ma, Hao, et al.
Veröffentlicht: (2025)
von: Ma, Hao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
von: Lv, Lei, et al.
Veröffentlicht: (2026) -
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
von: Luo, Yu, et al.
Veröffentlicht: (2024) -
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
von: Cai, Ruichu, et al.
Veröffentlicht: (2024) -
OMPO: A Unified Framework for RL under Policy and Dynamics Shifts
von: Luo, Yu, et al.
Veröffentlicht: (2024) -
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
von: Luo, Yu, et al.
Veröffentlicht: (2024)