Reparameterization Flow Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhong, Hai, Li, Zhuoran, Wang, Xun, Huang, Longbo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025)
por: Zhong, Hai, et al.
Publicado: (2025)
OM2P: Offline Multi-Agent Mean-Flow Policy
por: Li, Zhuoran, et al.
Publicado: (2025)
por: Li, Zhuoran, et al.
Publicado: (2025)
Beyond Shallow Behavior: Task-Efficient Value-Based Multi-Task Offline MARL via Skill Discovery
por: Wang, Xun, et al.
Publicado: (2025)
por: Wang, Xun, et al.
Publicado: (2025)
Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training
por: Chen, Ruishuo, et al.
Publicado: (2025)
por: Chen, Ruishuo, et al.
Publicado: (2025)
Beyond Squared Error: Exploring Loss Design for Enhanced Training of Generative Flow Networks
por: Hu, Rui, et al.
Publicado: (2024)
por: Hu, Rui, et al.
Publicado: (2024)
PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching
por: Chen, Ruishuo, et al.
Publicado: (2026)
por: Chen, Ruishuo, et al.
Publicado: (2026)
Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration
por: Zhong, Hai, et al.
Publicado: (2024)
por: Zhong, Hai, et al.
Publicado: (2024)
Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies
por: Li, Zhuoran, et al.
Publicado: (2026)
por: Li, Zhuoran, et al.
Publicado: (2026)
Offline Critic-Guided Diffusion Policy for Multi-User Delay-Constrained Scheduling
por: Li, Zhuoran, et al.
Publicado: (2025)
por: Li, Zhuoran, et al.
Publicado: (2025)
From Solo to Symphony: Orchestrating Multi-Agent Collaboration with Single-Agent Demos
por: Wang, Xun, et al.
Publicado: (2025)
por: Wang, Xun, et al.
Publicado: (2025)
Network Topology Optimization via Deep Reinforcement Learning
por: Li, Zhuoran, et al.
Publicado: (2022)
por: Li, Zhuoran, et al.
Publicado: (2022)
Decision Flow Policy Optimization
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
por: Kang, Hyeongyu, et al.
Publicado: (2025)
por: Kang, Hyeongyu, et al.
Publicado: (2025)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
por: Zheng, Zhi, et al.
Publicado: (2025)
por: Zheng, Zhi, et al.
Publicado: (2025)
Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
por: Hu, Rui, et al.
Publicado: (2025)
por: Hu, Rui, et al.
Publicado: (2025)
Layer-Aware Influence for Online Data Valuation Estimation
por: Yang, Ziao, et al.
Publicado: (2025)
por: Yang, Ziao, et al.
Publicado: (2025)
Real-Time Parallel Counterfactual Regret Minimization
por: Li, Boning, et al.
Publicado: (2026)
por: Li, Boning, et al.
Publicado: (2026)
Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate
por: Xu, Huangyu, et al.
Publicado: (2026)
por: Xu, Huangyu, et al.
Publicado: (2026)
$\clubsuit$ CLOVER $\clubsuit$: Probabilistic Forecasting with Coherent Learning Objective Reparameterization
por: Olivares, Kin G., et al.
Publicado: (2023)
por: Olivares, Kin G., et al.
Publicado: (2023)
ReMAP: Neural Reparameterization for Scalable MAP Inference in Arbitrary-Order Markov Random Fields
por: Wang, Yaomin, et al.
Publicado: (2024)
por: Wang, Yaomin, et al.
Publicado: (2024)
Flow-based Policy With Distributional Reinforcement Learning in Trajectory Optimization
por: Hao, Ruijie, et al.
Publicado: (2026)
por: Hao, Ruijie, et al.
Publicado: (2026)
Score-Based One-step MeanFlow Policy Optimization
por: Kim, Kyungyoon, et al.
Publicado: (2026)
por: Kim, Kyungyoon, et al.
Publicado: (2026)
Variational Delayed Policy Optimization
por: Wu, Qingyuan, et al.
Publicado: (2024)
por: Wu, Qingyuan, et al.
Publicado: (2024)
Trust-Region Adaptive Policy Optimization
por: Su, Mingyu, et al.
Publicado: (2025)
por: Su, Mingyu, et al.
Publicado: (2025)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
Divergence-Augmented Policy Optimization
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
CROP: Conservative Reward for Model-based Offline Policy Optimization
por: Li, Hao, et al.
Publicado: (2023)
por: Li, Hao, et al.
Publicado: (2023)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
por: Xu, Huimin, et al.
Publicado: (2026)
por: Xu, Huimin, et al.
Publicado: (2026)
Graph-attention-based Casual Discovery with Trust Region-navigated Clipping Policy Optimization
por: Liu, Shixuan, et al.
Publicado: (2024)
por: Liu, Shixuan, et al.
Publicado: (2024)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
por: Qiu, Zeju, et al.
Publicado: (2025)
por: Qiu, Zeju, et al.
Publicado: (2025)
Generative Neural Reparameterization for Differentiable PDE-constrained Optimization
por: Joglekar, Archis S.
Publicado: (2024)
por: Joglekar, Archis S.
Publicado: (2024)
PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
por: Lu, Wenquan, et al.
Publicado: (2026)
por: Lu, Wenquan, et al.
Publicado: (2026)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
TreeRPO: Tree Relative Policy Optimization
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)
por: Yang, Shuo, et al.
Publicado: (2026)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
por: Huang, Chenghua, et al.
Publicado: (2025)
por: Huang, Chenghua, et al.
Publicado: (2025)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation
por: Zhan, Guojian, et al.
Publicado: (2026)
por: Zhan, Guojian, et al.
Publicado: (2026)
StableSSM: Alleviating the Curse of Memory in State-space Models through Stable Reparameterization
por: Wang, Shida, et al.
Publicado: (2023)
por: Wang, Shida, et al.
Publicado: (2023)
NGRPO: Negative-enhanced Group Relative Policy Optimization
por: Nan, Gongrui, et al.
Publicado: (2025)
por: Nan, Gongrui, et al.
Publicado: (2025)
Ejemplares similares
-
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025) -
OM2P: Offline Multi-Agent Mean-Flow Policy
por: Li, Zhuoran, et al.
Publicado: (2025) -
Beyond Shallow Behavior: Task-Efficient Value-Based Multi-Task Offline MARL via Skill Discovery
por: Wang, Xun, et al.
Publicado: (2025) -
Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training
por: Chen, Ruishuo, et al.
Publicado: (2025) -
Beyond Squared Error: Exploring Loss Design for Enhanced Training of Generative Flow Networks
por: Hu, Rui, et al.
Publicado: (2024)