Learning Intractable Multimodal Policies with Reparameterization and Diversity Regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Ziqi, Liu, Jiashun, Pan, Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Neuroplastic Expansion in Deep Reinforcement Learning
par: Liu, Jiashun, et autres
Publié: (2024)
par: Liu, Jiashun, et autres
Publié: (2024)
Reparameterization Proximal Policy Optimization
par: Zhong, Hai, et autres
Publié: (2025)
par: Zhong, Hai, et autres
Publié: (2025)
Reparameterization Flow Policy Optimization
par: Zhong, Hai, et autres
Publié: (2026)
par: Zhong, Hai, et autres
Publié: (2026)
The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning
par: Liu, Jiashun, et autres
Publié: (2025)
par: Liu, Jiashun, et autres
Publié: (2025)
Performative Prediction with Bandit Feedback: Learning through Reparameterization
par: Chen, Yatong, et autres
Publié: (2023)
par: Chen, Yatong, et autres
Publié: (2023)
SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
par: Zhang, Yixian, et autres
Publié: (2025)
par: Zhang, Yixian, et autres
Publié: (2025)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
par: Zheng, Zhi, et autres
Publié: (2025)
par: Zheng, Zhi, et autres
Publié: (2025)
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
par: Kang, Hyeongyu, et autres
Publié: (2025)
par: Kang, Hyeongyu, et autres
Publié: (2025)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
par: Liu, Jiashun, et autres
Publié: (2025)
par: Liu, Jiashun, et autres
Publié: (2025)
Fitting networks with a cancellation trick
par: Jin, Jiashun, et autres
Publié: (2025)
par: Jin, Jiashun, et autres
Publié: (2025)
Categorical Reparameterization with Denoising Diffusion models
par: Gourevitch, Samson, et autres
Publié: (2026)
par: Gourevitch, Samson, et autres
Publié: (2026)
Reparameterization invariance in approximate Bayesian inference
par: Roy, Hrittik, et autres
Publié: (2024)
par: Roy, Hrittik, et autres
Publié: (2024)
Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning
par: Liu, Jiashun, et autres
Publié: (2025)
par: Liu, Jiashun, et autres
Publié: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
par: Liu, Tenglong, et autres
Publié: (2024)
par: Liu, Tenglong, et autres
Publié: (2024)
Expanding Horizons of Level Diversity via Multi-objective Evolutionary Learning
par: Zhang, Qingquan, et autres
Publié: (2025)
par: Zhang, Qingquan, et autres
Publié: (2025)
Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion
par: Xia, Zixuan, et autres
Publié: (2026)
par: Xia, Zixuan, et autres
Publié: (2026)
MCNC: Manifold-Constrained Reparameterization for Neural Compression
par: Thrash, Chayne, et autres
Publié: (2024)
par: Thrash, Chayne, et autres
Publié: (2024)
Reparameterization through Coverings and Topological Weight Priors
par: Beketov, Maxim, et autres
Publié: (2026)
par: Beketov, Maxim, et autres
Publié: (2026)
Strategy and Skill Learning for Physics-based Table Tennis Animation
par: Wang, Jiashun, et autres
Publié: (2024)
par: Wang, Jiashun, et autres
Publié: (2024)
Complementary Reinforcement Learning
par: Muhtar, Dilxat, et autres
Publié: (2026)
par: Muhtar, Dilxat, et autres
Publié: (2026)
Importance Weighted Variational Inference without the Reparameterization Trick
par: Daudel, Kamélia, et autres
Publié: (2026)
par: Daudel, Kamélia, et autres
Publié: (2026)
Stein's Lemma for the Reparameterization Trick with Exponential Family Mixtures
par: Lin, Wu, et autres
Publié: (2019)
par: Lin, Wu, et autres
Publié: (2019)
Enhancing Hypergradients Estimation: A Study of Preconditioning and Reparameterization
par: Ye, Zhenzhang, et autres
Publié: (2024)
par: Ye, Zhenzhang, et autres
Publié: (2024)
Never Saddle for Reparameterized Steepest Descent as Mirror Flow
par: Jacobs, Tom, et autres
Publié: (2026)
par: Jacobs, Tom, et autres
Publié: (2026)
Learning Diverse Policies with Soft Self-Generated Guidance
par: Wang, Guojian, et autres
Publié: (2024)
par: Wang, Guojian, et autres
Publié: (2024)
$\clubsuit$ CLOVER $\clubsuit$: Probabilistic Forecasting with Coherent Learning Objective Reparameterization
par: Olivares, Kin G., et autres
Publié: (2023)
par: Olivares, Kin G., et autres
Publié: (2023)
Diffusion Posterior Sampling is Computationally Intractable
par: Gupta, Shivam, et autres
Publié: (2024)
par: Gupta, Shivam, et autres
Publié: (2024)
Revisiting LoRA through the Lens of Parameter Redundancy: Spectral Encoding Helps
par: Cheng, Jiashun, et autres
Publié: (2025)
par: Cheng, Jiashun, et autres
Publié: (2025)
Flow-Based Density Ratio Estimation for Intractable Distributions with Applications in Genomics
par: Antipov, Egor, et autres
Publié: (2026)
par: Antipov, Egor, et autres
Publié: (2026)
Parameter-Efficient Fine-Tuning via Circular Convolution
par: Chen, Aochuan, et autres
Publié: (2024)
par: Chen, Aochuan, et autres
Publié: (2024)
Revisiting Prefix-tuning: Statistical Benefits of Reparameterization among Prompts
par: Le, Minh, et autres
Publié: (2024)
par: Le, Minh, et autres
Publié: (2024)
Random Policy Evaluation Uncovers Policies of Generative Flow Networks
par: He, Haoran, et autres
Publié: (2024)
par: He, Haoran, et autres
Publié: (2024)
Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation
par: Gu, Jingwen, et autres
Publié: (2025)
par: Gu, Jingwen, et autres
Publié: (2025)
Hypercube Policy Regularization Framework for Offline Reinforcement Learning
par: Shen, Yi, et autres
Publié: (2024)
par: Shen, Yi, et autres
Publié: (2024)
Data Diversity as Implicit Regularization: How Does Diversity Shape the Weight Space of Deep Neural Networks?
par: Ba, Yang, et autres
Publié: (2024)
par: Ba, Yang, et autres
Publié: (2024)
Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate
par: Xu, Huangyu, et autres
Publié: (2026)
par: Xu, Huangyu, et autres
Publié: (2026)
Reparameterizing 4DVAR with neural fields
par: Oh, Jaemin
Publié: (2025)
par: Oh, Jaemin
Publié: (2025)
DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick
par: Vali, Mohammad Hassan, et autres
Publié: (2025)
par: Vali, Mohammad Hassan, et autres
Publié: (2025)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
par: Qiu, Zeju, et autres
Publié: (2025)
par: Qiu, Zeju, et autres
Publié: (2025)
Leveraging Nested MLMC for Sequential Neural Posterior Estimation with Intractable Likelihoods
par: Yang, Xiliang, et autres
Publié: (2024)
par: Yang, Xiliang, et autres
Publié: (2024)
Documents similaires
-
Neuroplastic Expansion in Deep Reinforcement Learning
par: Liu, Jiashun, et autres
Publié: (2024) -
Reparameterization Proximal Policy Optimization
par: Zhong, Hai, et autres
Publié: (2025) -
Reparameterization Flow Policy Optimization
par: Zhong, Hai, et autres
Publié: (2026) -
The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning
par: Liu, Jiashun, et autres
Publié: (2025) -
Performative Prediction with Bandit Feedback: Learning through Reparameterization
par: Chen, Yatong, et autres
Publié: (2023)