Evolving Diffusion and Flow Matching Policies for Online Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Chubin, Wan, Zhenglin, Chen, Feng, Yang, Fuchao, Feng, Lang, Zhou, Yaxin, Yu, Xingrui, You, Yang, Tsang, Ivor, An, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
par: Wan, Zhenglin, et autres
Publié: (2025)
par: Wan, Zhenglin, et autres
Publié: (2025)
Adversarial Dual On-Policy Distillation from Expressive Teacher
par: Wan, Zhenglin, et autres
Publié: (2026)
par: Wan, Zhenglin, et autres
Publié: (2026)
Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
par: Wu, Jingxuan, et autres
Publié: (2025)
par: Wu, Jingxuan, et autres
Publié: (2025)
HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models
par: Yan, Xin, et autres
Publié: (2026)
par: Yan, Xin, et autres
Publié: (2026)
Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models
par: Wu, Jingxuan, et autres
Publié: (2026)
par: Wu, Jingxuan, et autres
Publié: (2026)
AgentOCR: Reimagining Agent History via Optical Self-Compression
par: Feng, Lang, et autres
Publié: (2026)
par: Feng, Lang, et autres
Publié: (2026)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
par: Pan, Xu, et autres
Publié: (2026)
par: Pan, Xu, et autres
Publié: (2026)
Imitation from Diverse Behaviors: Wasserstein Quality Diversity Imitation Learning with Single-Step Archive Exploration
par: Yu, Xingrui, et autres
Publié: (2024)
par: Yu, Xingrui, et autres
Publié: (2024)
Diversifying Policy Behaviors with Extrinsic Behavioral Curiosity
par: Wan, Zhenglin, et autres
Publié: (2024)
par: Wan, Zhenglin, et autres
Publié: (2024)
Flow-Factory: A Unified Framework for Reinforcement Learning in Flow-Matching Models
par: Ping, Bowen, et autres
Publié: (2026)
par: Ping, Bowen, et autres
Publié: (2026)
Advancing Analytic Class-Incremental Learning through Vision-Language Calibration
par: Zhao, Binyu, et autres
Publié: (2026)
par: Zhao, Binyu, et autres
Publié: (2026)
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
par: Zhang, Tonghe, et autres
Publié: (2025)
par: Zhang, Tonghe, et autres
Publié: (2025)
Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies
par: Li, Zeyang, et autres
Publié: (2026)
par: Li, Zeyang, et autres
Publié: (2026)
Mitigating Mismatch within Reference-based Preference Optimization
par: Yuan, Suqin, et autres
Publié: (2026)
par: Yuan, Suqin, et autres
Publié: (2026)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Efficient Online Reinforcement Learning for Diffusion Policy
par: Ma, Haitong, et autres
Publié: (2025)
par: Ma, Haitong, et autres
Publié: (2025)
Reinforcement Learning for Flow-Matching Policies
par: Pfrommer, Samuel, et autres
Publié: (2025)
par: Pfrommer, Samuel, et autres
Publié: (2025)
FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies
par: Gao, Chenxiao, et autres
Publié: (2026)
par: Gao, Chenxiao, et autres
Publié: (2026)
Flow-Based Policy for Online Reinforcement Learning
par: Lv, Lei, et autres
Publié: (2025)
par: Lv, Lei, et autres
Publié: (2025)
PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning
par: Yang, Shunpeng, et autres
Publié: (2026)
par: Yang, Shunpeng, et autres
Publié: (2026)
Controllable Flow Matching for Online Reinforcement Learning
par: Wang, Bin, et autres
Publié: (2025)
par: Wang, Bin, et autres
Publié: (2025)
Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
par: Sun, Ming, et autres
Publié: (2026)
par: Sun, Ming, et autres
Publié: (2026)
Fast Direct: Query-Efficient Online Black-box Guidance for Diffusion-model Target Generation
par: Tan, Kim Yong, et autres
Publié: (2025)
par: Tan, Kim Yong, et autres
Publié: (2025)
Max-Entropy Reinforcement Learning with Flow Matching and A Case Study on LQR
par: Zhang, Yuyang, et autres
Publié: (2025)
par: Zhang, Yuyang, et autres
Publié: (2025)
Discrete Flow Matching for Offline-to-Online Reinforcement Learning
par: Khan, Fairoz Nower, et autres
Publié: (2026)
par: Khan, Fairoz Nower, et autres
Publié: (2026)
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
par: Xue, Zhenghai, et autres
Publié: (2025)
par: Xue, Zhenghai, et autres
Publié: (2025)
Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling
par: Zhou, Xubin, et autres
Publié: (2026)
par: Zhou, Xubin, et autres
Publié: (2026)
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
par: Shin, Yongjae, et autres
Publié: (2026)
par: Shin, Yongjae, et autres
Publié: (2026)
Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy
par: Mignacco, Chiara, et autres
Publié: (2025)
par: Mignacco, Chiara, et autres
Publié: (2025)
Learning Discretized Neural Networks under Ricci Flow
par: Chen, Jun, et autres
Publié: (2023)
par: Chen, Jun, et autres
Publié: (2023)
Flow Matching Policy Gradients
par: McAllister, David, et autres
Publié: (2025)
par: McAllister, David, et autres
Publié: (2025)
Do You Trust the Process?: Modeling Institutional Trust for Community Adoption of Reinforcement Learning Policies
par: Balepur, Naina, et autres
Publié: (2025)
par: Balepur, Naina, et autres
Publié: (2025)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
par: Liu, Xu-Hui, et autres
Publié: (2024)
par: Liu, Xu-Hui, et autres
Publié: (2024)
Balanced Image Stylization with Style Matching Score
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind
par: Yu, Yajie, et autres
Publié: (2025)
par: Yu, Yajie, et autres
Publié: (2025)
Uncover and Unlearn Nuisances: Agnostic Fully Test-Time Adaptation
par: Srey, Ponhvoan, et autres
Publié: (2025)
par: Srey, Ponhvoan, et autres
Publié: (2025)
Flow Matching for Offline Reinforcement Learning with Discrete Actions
par: Khan, Fairoz Nower, et autres
Publié: (2026)
par: Khan, Fairoz Nower, et autres
Publié: (2026)
Mastering Continual Reinforcement Learning through Fine-Grained Sparse Network Allocation and Dormant Neuron Exploration
par: Zheng, Chengqi, et autres
Publié: (2025)
par: Zheng, Chengqi, et autres
Publié: (2025)
Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field
par: Tan, Kim Yong, et autres
Publié: (2026)
par: Tan, Kim Yong, et autres
Publié: (2026)
Policy Dispersion in Non-Markovian Environment
par: Qu, Bohao, et autres
Publié: (2023)
par: Qu, Bohao, et autres
Publié: (2023)
Documents similaires
-
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
par: Wan, Zhenglin, et autres
Publié: (2025) -
Adversarial Dual On-Policy Distillation from Expressive Teacher
par: Wan, Zhenglin, et autres
Publié: (2026) -
Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
par: Wu, Jingxuan, et autres
Publié: (2025) -
HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models
par: Yan, Xin, et autres
Publié: (2026) -
Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models
par: Wu, Jingxuan, et autres
Publié: (2026)