Guardado en:
| Autores principales: | Wang, Ziqi, Liu, Jiashun, Pan, Ling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2511.01374 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Neuroplastic Expansion in Deep Reinforcement Learning
por: Liu, Jiashun, et al.
Publicado: (2024)
por: Liu, Jiashun, et al.
Publicado: (2024)
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025)
por: Zhong, Hai, et al.
Publicado: (2025)
Reparameterization Flow Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2026)
por: Zhong, Hai, et al.
Publicado: (2026)
The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning
por: Liu, Jiashun, et al.
Publicado: (2025)
por: Liu, Jiashun, et al.
Publicado: (2025)
Performative Prediction with Bandit Feedback: Learning through Reparameterization
por: Chen, Yatong, et al.
Publicado: (2023)
por: Chen, Yatong, et al.
Publicado: (2023)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
por: Liu, Jiashun, et al.
Publicado: (2025)
por: Liu, Jiashun, et al.
Publicado: (2025)
SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
por: Zhang, Yixian, et al.
Publicado: (2025)
por: Zhang, Yixian, et al.
Publicado: (2025)
Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning
por: Liu, Jiashun, et al.
Publicado: (2025)
por: Liu, Jiashun, et al.
Publicado: (2025)
Fitting networks with a cancellation trick
por: Jin, Jiashun, et al.
Publicado: (2025)
por: Jin, Jiashun, et al.
Publicado: (2025)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
por: Zheng, Zhi, et al.
Publicado: (2025)
por: Zheng, Zhi, et al.
Publicado: (2025)
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
por: Kang, Hyeongyu, et al.
Publicado: (2025)
por: Kang, Hyeongyu, et al.
Publicado: (2025)
Strategy and Skill Learning for Physics-based Table Tennis Animation
por: Wang, Jiashun, et al.
Publicado: (2024)
por: Wang, Jiashun, et al.
Publicado: (2024)
Categorical Reparameterization with Denoising Diffusion models
por: Gourevitch, Samson, et al.
Publicado: (2026)
por: Gourevitch, Samson, et al.
Publicado: (2026)
Reparameterization invariance in approximate Bayesian inference
por: Roy, Hrittik, et al.
Publicado: (2024)
por: Roy, Hrittik, et al.
Publicado: (2024)
Complementary Reinforcement Learning
por: Muhtar, Dilxat, et al.
Publicado: (2026)
por: Muhtar, Dilxat, et al.
Publicado: (2026)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
por: Liu, Tenglong, et al.
Publicado: (2024)
por: Liu, Tenglong, et al.
Publicado: (2024)
Expanding Horizons of Level Diversity via Multi-objective Evolutionary Learning
por: Zhang, Qingquan, et al.
Publicado: (2025)
por: Zhang, Qingquan, et al.
Publicado: (2025)
Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion
por: Xia, Zixuan, et al.
Publicado: (2026)
por: Xia, Zixuan, et al.
Publicado: (2026)
Parameter-Efficient Fine-Tuning via Circular Convolution
por: Chen, Aochuan, et al.
Publicado: (2024)
por: Chen, Aochuan, et al.
Publicado: (2024)
Revisiting LoRA through the Lens of Parameter Redundancy: Spectral Encoding Helps
por: Cheng, Jiashun, et al.
Publicado: (2025)
por: Cheng, Jiashun, et al.
Publicado: (2025)
MCNC: Manifold-Constrained Reparameterization for Neural Compression
por: Thrash, Chayne, et al.
Publicado: (2024)
por: Thrash, Chayne, et al.
Publicado: (2024)
Reparameterization through Coverings and Topological Weight Priors
por: Beketov, Maxim, et al.
Publicado: (2026)
por: Beketov, Maxim, et al.
Publicado: (2026)
Diffusion Posterior Sampling is Computationally Intractable
por: Gupta, Shivam, et al.
Publicado: (2024)
por: Gupta, Shivam, et al.
Publicado: (2024)
Importance Weighted Variational Inference without the Reparameterization Trick
por: Daudel, Kamélia, et al.
Publicado: (2026)
por: Daudel, Kamélia, et al.
Publicado: (2026)
Stein's Lemma for the Reparameterization Trick with Exponential Family Mixtures
por: Lin, Wu, et al.
Publicado: (2019)
por: Lin, Wu, et al.
Publicado: (2019)
Enhancing Hypergradients Estimation: A Study of Preconditioning and Reparameterization
por: Ye, Zhenzhang, et al.
Publicado: (2024)
por: Ye, Zhenzhang, et al.
Publicado: (2024)
Never Saddle for Reparameterized Steepest Descent as Mirror Flow
por: Jacobs, Tom, et al.
Publicado: (2026)
por: Jacobs, Tom, et al.
Publicado: (2026)
Learning Diverse Policies with Soft Self-Generated Guidance
por: Wang, Guojian, et al.
Publicado: (2024)
por: Wang, Guojian, et al.
Publicado: (2024)
$\clubsuit$ CLOVER $\clubsuit$: Probabilistic Forecasting with Coherent Learning Objective Reparameterization
por: Olivares, Kin G., et al.
Publicado: (2023)
por: Olivares, Kin G., et al.
Publicado: (2023)
Random Policy Evaluation Uncovers Policies of Generative Flow Networks
por: He, Haoran, et al.
Publicado: (2024)
por: He, Haoran, et al.
Publicado: (2024)
Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation
por: Gu, Jingwen, et al.
Publicado: (2025)
por: Gu, Jingwen, et al.
Publicado: (2025)
Reparameterizing 4DVAR with neural fields
por: Oh, Jaemin
Publicado: (2025)
por: Oh, Jaemin
Publicado: (2025)
Data Diversity as Implicit Regularization: How Does Diversity Shape the Weight Space of Deep Neural Networks?
por: Ba, Yang, et al.
Publicado: (2024)
por: Ba, Yang, et al.
Publicado: (2024)
Flow-Based Density Ratio Estimation for Intractable Distributions with Applications in Genomics
por: Antipov, Egor, et al.
Publicado: (2026)
por: Antipov, Egor, et al.
Publicado: (2026)
Revisiting Prefix-tuning: Statistical Benefits of Reparameterization among Prompts
por: Le, Minh, et al.
Publicado: (2024)
por: Le, Minh, et al.
Publicado: (2024)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
por: Qiu, Zeju, et al.
Publicado: (2025)
por: Qiu, Zeju, et al.
Publicado: (2025)
Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate
por: Xu, Huangyu, et al.
Publicado: (2026)
por: Xu, Huangyu, et al.
Publicado: (2026)
A Stein Gradient Descent Approach for Doubly Intractable Distributions
por: Lee, Heesang, et al.
Publicado: (2024)
por: Lee, Heesang, et al.
Publicado: (2024)
A Reparameterized Discrete Diffusion Model for Text Generation
por: Zheng, Lin, et al.
Publicado: (2023)
por: Zheng, Lin, et al.
Publicado: (2023)
GauS: Differentiable Scheduling Optimization via Gaussian Reparameterization
por: Cai, Yaohui, et al.
Publicado: (2026)
por: Cai, Yaohui, et al.
Publicado: (2026)
Ejemplares similares
-
Neuroplastic Expansion in Deep Reinforcement Learning
por: Liu, Jiashun, et al.
Publicado: (2024) -
Reparameterization Proximal Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2025) -
Reparameterization Flow Policy Optimization
por: Zhong, Hai, et al.
Publicado: (2026) -
The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning
por: Liu, Jiashun, et al.
Publicado: (2025) -
Performative Prediction with Bandit Feedback: Learning through Reparameterization
por: Chen, Yatong, et al.
Publicado: (2023)