Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Yifu, Sun, Haoyuan, Hu, Xinhao, Du, Penghui, Fan, Keyu, Li, Bo, Du, Sinan, Wan, Xu, Chen, Zhiyu, Xia, Bo, Zhang, Tiantian, Chang, Yongzhe, Yu, Changqian, Gai, Kun, Wang, Xueqian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
par: Luo, Yifu, et autres
Publié: (2025)
par: Luo, Yifu, et autres
Publié: (2025)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
par: Sun, Haoyuan, et autres
Publié: (2024)
par: Sun, Haoyuan, et autres
Publié: (2024)
A Method on Searching Better Activation Functions
par: Sun, Haoyuan, et autres
Publié: (2024)
par: Sun, Haoyuan, et autres
Publié: (2024)
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
par: Luo, Yifu, et autres
Publié: (2025)
par: Luo, Yifu, et autres
Publié: (2025)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)
par: Sun, Haoyuan, et autres
Publié: (2025)
DEER: A Delay-Resilient Framework for Reinforcement Learning with Variable Delays
par: Xia, Bo, et autres
Publié: (2024)
par: Xia, Bo, et autres
Publié: (2024)
UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning
par: Wu, Jiaxi, et autres
Publié: (2025)
par: Wu, Jiaxi, et autres
Publié: (2025)
Embodied Co-Design for Rapidly Evolving Agents: Taxonomy, Frontiers, and Challenges
par: Wang, Yuxing, et autres
Publié: (2025)
par: Wang, Yuxing, et autres
Publié: (2025)
FlowErase-RL: Rethinking Concept Erasure as Reward Optimization in Flow Matching Models
par: Sun, Yi, et autres
Publié: (2026)
par: Sun, Yi, et autres
Publié: (2026)
Go Beyond Black-box Policies: Rethinking the Design of Learning Agent for Interpretable and Verifiable HVAC Control
par: An, Zhiyu, et autres
Publié: (2024)
par: An, Zhiyu, et autres
Publié: (2024)
IS-Diff: Improving Diffusion-Based Inpainting with Better Initial Seed
par: Lyu, Yongzhe, et autres
Publié: (2025)
par: Lyu, Yongzhe, et autres
Publié: (2025)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
par: Wang, Fangyuan, et autres
Publié: (2022)
par: Wang, Fangyuan, et autres
Publié: (2022)
VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
par: Du, Sinan, et autres
Publié: (2025)
par: Du, Sinan, et autres
Publié: (2025)
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
par: An, Zhiyu, et autres
Publié: (2026)
par: An, Zhiyu, et autres
Publié: (2026)
DIML: Differentiable Inverse Mechanism Learning from Behaviors of Multi-Agent Learning Trajectories
par: An, Zhiyu, et autres
Publié: (2026)
par: An, Zhiyu, et autres
Publié: (2026)
MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
par: An, Zhiyu, et autres
Publié: (2025)
par: An, Zhiyu, et autres
Publié: (2025)
Representational Homomorphism Predicts and Improves Compositional Generalization In Transformer Language Model
par: An, Zhiyu, et autres
Publié: (2026)
par: An, Zhiyu, et autres
Publié: (2026)
FocalPolicy: Frequency-Optimized Chunking and Locally Anchored Flow Matching for Coherent Visuomotor Policy
par: He, Qian, et autres
Publié: (2026)
par: He, Qian, et autres
Publié: (2026)
Generative Modeling with Orbit-Space Particle Flow Matching
par: Wang, Sinan, et autres
Publié: (2026)
par: Wang, Sinan, et autres
Publié: (2026)
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
par: Lu, Wensheng, et autres
Publié: (2025)
par: Lu, Wensheng, et autres
Publié: (2025)
Lagrangian Flow Matching: A Least-Action Framework for Principled Path Design
par: Du, Shukai, et autres
Publié: (2026)
par: Du, Shukai, et autres
Publié: (2026)
Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping
par: Sun, Haoyuan, et autres
Publié: (2026)
par: Sun, Haoyuan, et autres
Publié: (2026)
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
par: Wan, Zhenglin, et autres
Publié: (2025)
par: Wan, Zhenglin, et autres
Publié: (2025)
FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies
par: Gao, Chenxiao, et autres
Publié: (2026)
par: Gao, Chenxiao, et autres
Publié: (2026)
Evolving Diffusion and Flow Matching Policies for Online Reinforcement Learning
par: Zhang, Chubin, et autres
Publié: (2025)
par: Zhang, Chubin, et autres
Publié: (2025)
Differential Voting: Loss Functions For Axiomatically Diverse Aggregation of Heterogeneous Preferences
par: An, Zhiyu, et autres
Publié: (2026)
par: An, Zhiyu, et autres
Publié: (2026)
Reward Bound for Behavioral Guarantee of Model-based Planning Agents
par: An, Zhiyu, et autres
Publié: (2024)
par: An, Zhiyu, et autres
Publié: (2024)
Beyond Noisy-TVs: Noise-Robust Exploration Via Learning Progress Monitoring
par: Hou, Zhibo, et autres
Publié: (2025)
par: Hou, Zhibo, et autres
Publié: (2025)
Disentangling Uncertainties by Learning Compressed Data Representation
par: An, Zhiyu, et autres
Publié: (2025)
par: An, Zhiyu, et autres
Publié: (2025)
When Less Latent Leads to Better Relay: Information-Preserving Compression for Latent Multi-Agent LLM Collaboration
par: Li, Yiping, et autres
Publié: (2026)
par: Li, Yiping, et autres
Publié: (2026)
PaddingFlow: Improving Normalizing Flows with Padding-Dimensional Noise
par: Meng, Qinglong, et autres
Publié: (2024)
par: Meng, Qinglong, et autres
Publié: (2024)
Learning Native Continuation for Action Chunking Flow Policies
par: Liu, Yufeng, et autres
Publié: (2026)
par: Liu, Yufeng, et autres
Publié: (2026)
Real-Time Execution of Action Chunking Flow Policies
par: Black, Kevin, et autres
Publié: (2025)
par: Black, Kevin, et autres
Publié: (2025)
Emerging Technologies
par: Küfeoğlu, Sinan
Publié: (2022)
par: Küfeoğlu, Sinan
Publié: (2022)
Visual Generation Tuning
par: Guo, Jiahao, et autres
Publié: (2025)
par: Guo, Jiahao, et autres
Publié: (2025)
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
Virtual specialness of the double
par: Li, Changqian
Publié: (2026)
par: Li, Changqian
Publié: (2026)
Finite Stature in Graphs of Cube Complexes with Cyclonormal Edges
par: Li, Changqian
Publié: (2026)
par: Li, Changqian
Publié: (2026)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
Exploring the Impact of Resistance to AI , Cultural Openness and Collaboration on STEM Teachers' Professional Development: A Structural Equation Modelling Study
par: Bo Sun, et autres
Publié: (2025)
par: Bo Sun, et autres
Publié: (2025)
Documents similaires
-
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
par: Luo, Yifu, et autres
Publié: (2025) -
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
par: Sun, Haoyuan, et autres
Publié: (2024) -
A Method on Searching Better Activation Functions
par: Sun, Haoyuan, et autres
Publié: (2024) -
Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning
par: Luo, Yifu, et autres
Publié: (2025) -
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)