Guardado en:
| Autores principales: | Zhang, Chubin, Wan, Zhenglin, Chen, Feng, Yang, Fuchao, Feng, Lang, Zhou, Yaxin, Yu, Xingrui, You, Yang, Tsang, Ivor, An, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2512.02581 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
por: Wan, Zhenglin, et al.
Publicado: (2025)
por: Wan, Zhenglin, et al.
Publicado: (2025)
Adversarial Dual On-Policy Distillation from Expressive Teacher
por: Wan, Zhenglin, et al.
Publicado: (2026)
por: Wan, Zhenglin, et al.
Publicado: (2026)
Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
por: Wu, Jingxuan, et al.
Publicado: (2025)
por: Wu, Jingxuan, et al.
Publicado: (2025)
HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models
por: Yan, Xin, et al.
Publicado: (2026)
por: Yan, Xin, et al.
Publicado: (2026)
Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models
por: Wu, Jingxuan, et al.
Publicado: (2026)
por: Wu, Jingxuan, et al.
Publicado: (2026)
AgentOCR: Reimagining Agent History via Optical Self-Compression
por: Feng, Lang, et al.
Publicado: (2026)
por: Feng, Lang, et al.
Publicado: (2026)
Imitation from Diverse Behaviors: Wasserstein Quality Diversity Imitation Learning with Single-Step Archive Exploration
por: Yu, Xingrui, et al.
Publicado: (2024)
por: Yu, Xingrui, et al.
Publicado: (2024)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
por: Pan, Xu, et al.
Publicado: (2026)
por: Pan, Xu, et al.
Publicado: (2026)
Diversifying Policy Behaviors with Extrinsic Behavioral Curiosity
por: Wan, Zhenglin, et al.
Publicado: (2024)
por: Wan, Zhenglin, et al.
Publicado: (2024)
Flow-Factory: A Unified Framework for Reinforcement Learning in Flow-Matching Models
por: Ping, Bowen, et al.
Publicado: (2026)
por: Ping, Bowen, et al.
Publicado: (2026)
Advancing Analytic Class-Incremental Learning through Vision-Language Calibration
por: Zhao, Binyu, et al.
Publicado: (2026)
por: Zhao, Binyu, et al.
Publicado: (2026)
Mitigating Mismatch within Reference-based Preference Optimization
por: Yuan, Suqin, et al.
Publicado: (2026)
por: Yuan, Suqin, et al.
Publicado: (2026)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
por: Zhao, Heyang, et al.
Publicado: (2025)
por: Zhao, Heyang, et al.
Publicado: (2025)
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
por: Zhang, Tonghe, et al.
Publicado: (2025)
por: Zhang, Tonghe, et al.
Publicado: (2025)
Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies
por: Li, Zeyang, et al.
Publicado: (2026)
por: Li, Zeyang, et al.
Publicado: (2026)
Efficient Online Reinforcement Learning for Diffusion Policy
por: Ma, Haitong, et al.
Publicado: (2025)
por: Ma, Haitong, et al.
Publicado: (2025)
Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
por: Sun, Ming, et al.
Publicado: (2026)
por: Sun, Ming, et al.
Publicado: (2026)
Reinforcement Learning for Flow-Matching Policies
por: Pfrommer, Samuel, et al.
Publicado: (2025)
por: Pfrommer, Samuel, et al.
Publicado: (2025)
Fast Direct: Query-Efficient Online Black-box Guidance for Diffusion-model Target Generation
por: Tan, Kim Yong, et al.
Publicado: (2025)
por: Tan, Kim Yong, et al.
Publicado: (2025)
FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies
por: Gao, Chenxiao, et al.
Publicado: (2026)
por: Gao, Chenxiao, et al.
Publicado: (2026)
Flow-Based Policy for Online Reinforcement Learning
por: Lv, Lei, et al.
Publicado: (2025)
por: Lv, Lei, et al.
Publicado: (2025)
PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning
por: Yang, Shunpeng, et al.
Publicado: (2026)
por: Yang, Shunpeng, et al.
Publicado: (2026)
Controllable Flow Matching for Online Reinforcement Learning
por: Wang, Bin, et al.
Publicado: (2025)
por: Wang, Bin, et al.
Publicado: (2025)
Uncover and Unlearn Nuisances: Agnostic Fully Test-Time Adaptation
por: Srey, Ponhvoan, et al.
Publicado: (2025)
por: Srey, Ponhvoan, et al.
Publicado: (2025)
Learning Discretized Neural Networks under Ricci Flow
por: Chen, Jun, et al.
Publicado: (2023)
por: Chen, Jun, et al.
Publicado: (2023)
Balanced Image Stylization with Style Matching Score
por: Jiang, Yuxin, et al.
Publicado: (2025)
por: Jiang, Yuxin, et al.
Publicado: (2025)
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
por: Xue, Zhenghai, et al.
Publicado: (2025)
por: Xue, Zhenghai, et al.
Publicado: (2025)
Max-Entropy Reinforcement Learning with Flow Matching and A Case Study on LQR
por: Zhang, Yuyang, et al.
Publicado: (2025)
por: Zhang, Yuyang, et al.
Publicado: (2025)
Do You Trust the Process?: Modeling Institutional Trust for Community Adoption of Reinforcement Learning Policies
por: Balepur, Naina, et al.
Publicado: (2025)
por: Balepur, Naina, et al.
Publicado: (2025)
Discrete Flow Matching for Offline-to-Online Reinforcement Learning
por: Khan, Fairoz Nower, et al.
Publicado: (2026)
por: Khan, Fairoz Nower, et al.
Publicado: (2026)
Policy Dispersion in Non-Markovian Environment
por: Qu, Bohao, et al.
Publicado: (2023)
por: Qu, Bohao, et al.
Publicado: (2023)
Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field
por: Tan, Kim Yong, et al.
Publicado: (2026)
por: Tan, Kim Yong, et al.
Publicado: (2026)
Mastering Continual Reinforcement Learning through Fine-Grained Sparse Network Allocation and Dormant Neuron Exploration
por: Zheng, Chengqi, et al.
Publicado: (2025)
por: Zheng, Chengqi, et al.
Publicado: (2025)
Flow Matching Policy Gradients
por: McAllister, David, et al.
Publicado: (2025)
por: McAllister, David, et al.
Publicado: (2025)
Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling
por: Zhou, Xubin, et al.
Publicado: (2026)
por: Zhou, Xubin, et al.
Publicado: (2026)
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
por: Shin, Yongjae, et al.
Publicado: (2026)
por: Shin, Yongjae, et al.
Publicado: (2026)
Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy
por: Mignacco, Chiara, et al.
Publicado: (2025)
por: Mignacco, Chiara, et al.
Publicado: (2025)
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
por: Feng, Lang, et al.
Publicado: (2025)
por: Feng, Lang, et al.
Publicado: (2025)
PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind
por: Yu, Yajie, et al.
Publicado: (2025)
por: Yu, Yajie, et al.
Publicado: (2025)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
por: Liu, Xu-Hui, et al.
Publicado: (2024)
por: Liu, Xu-Hui, et al.
Publicado: (2024)
Ejemplares similares
-
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
por: Wan, Zhenglin, et al.
Publicado: (2025) -
Adversarial Dual On-Policy Distillation from Expressive Teacher
por: Wan, Zhenglin, et al.
Publicado: (2026) -
Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
por: Wu, Jingxuan, et al.
Publicado: (2025) -
HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models
por: Yan, Xin, et al.
Publicado: (2026) -
Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models
por: Wu, Jingxuan, et al.
Publicado: (2026)