Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Yan, Gao, Bin, Yuan, Ya-xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A space-decoupling framework for optimization on bounded-rank matrices with orthogonally invariant constraints
di: Yang, Yan, et al.
Pubblicazione: (2025)
di: Yang, Yan, et al.
Pubblicazione: (2025)
LancBiO: dynamic Lanczos-aided bilevel optimization via Krylov subspace
di: Yang, Yan, et al.
Pubblicazione: (2024)
di: Yang, Yan, et al.
Pubblicazione: (2024)
Linear convergence of forward-backward accelerated algorithms without knowledge of the modulus of strong convexity
di: Li, Bowen, et al.
Pubblicazione: (2023)
di: Li, Bowen, et al.
Pubblicazione: (2023)
Double Momentum Method for Lower-Level Constrained Bilevel Optimization
di: Shi, Wanli, et al.
Pubblicazione: (2024)
di: Shi, Wanli, et al.
Pubblicazione: (2024)
Convex and Bilevel Optimization for Neuro-Symbolic Inference and Learning
di: Dickens, Charles, et al.
Pubblicazione: (2024)
di: Dickens, Charles, et al.
Pubblicazione: (2024)
Riemannian Bilevel Optimization
di: Dutta, Sanchayan, et al.
Pubblicazione: (2024)
di: Dutta, Sanchayan, et al.
Pubblicazione: (2024)
On the Condition Number Dependency in Bilevel Optimization
di: Chen, Lesi, et al.
Pubblicazione: (2025)
di: Chen, Lesi, et al.
Pubblicazione: (2025)
Contextual Bilevel Reinforcement Learning for Incentive Alignment
di: Thoma, Vinzenz, et al.
Pubblicazione: (2024)
di: Thoma, Vinzenz, et al.
Pubblicazione: (2024)
Variational analysis of determinantal varieties
di: Yang, Yan, et al.
Pubblicazione: (2025)
di: Yang, Yan, et al.
Pubblicazione: (2025)
Neur2BiLO: Neural Bilevel Optimization
di: Dumouchelle, Justin, et al.
Pubblicazione: (2024)
di: Dumouchelle, Justin, et al.
Pubblicazione: (2024)
Bilevel Optimization over Saddle Points of Zero-Sum Markov Games
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
A second-order-like optimizer with adaptive gradient scaling for deep learning
di: Bolte, Jérôme, et al.
Pubblicazione: (2024)
di: Bolte, Jérôme, et al.
Pubblicazione: (2024)
On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis
di: Chen, Lesi, et al.
Pubblicazione: (2023)
di: Chen, Lesi, et al.
Pubblicazione: (2023)
Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior
di: Lawrence, Nathan P., et al.
Pubblicazione: (2023)
di: Lawrence, Nathan P., et al.
Pubblicazione: (2023)
Learning a local trading strategy: deep reinforcement learning for grid-scale renewable energy integration
di: Ju, Caleb, et al.
Pubblicazione: (2024)
di: Ju, Caleb, et al.
Pubblicazione: (2024)
Recurrent neural networks: vanishing and exploding gradients are not the end of the story
di: Zucchet, Nicolas, et al.
Pubblicazione: (2024)
di: Zucchet, Nicolas, et al.
Pubblicazione: (2024)
When majority rules, minority loses: bias amplification of gradient descent
di: Bachoc, François, et al.
Pubblicazione: (2025)
di: Bachoc, François, et al.
Pubblicazione: (2025)
SPAP: Structured Pruning via Alternating Optimization and Penalty Methods
di: Hu, Hanyu, et al.
Pubblicazione: (2025)
di: Hu, Hanyu, et al.
Pubblicazione: (2025)
Towards Faster Decentralized Stochastic Optimization with Communication Compression
di: Islamov, Rustem, et al.
Pubblicazione: (2024)
di: Islamov, Rustem, et al.
Pubblicazione: (2024)
MADA: Meta-Adaptive Optimizers through hyper-gradient Descent
di: Ozkara, Kaan, et al.
Pubblicazione: (2024)
di: Ozkara, Kaan, et al.
Pubblicazione: (2024)
Reward-Directed Score-Based Diffusion Models via q-Learning
di: Gao, Xuefeng, et al.
Pubblicazione: (2024)
di: Gao, Xuefeng, et al.
Pubblicazione: (2024)
Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2022)
di: Ding, Dongsheng, et al.
Pubblicazione: (2022)
Efficient and provably convergent end-to-end training of deep neural networks with linear constraints
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
A second-order method landing on the Stiefel manifold via Newton$\unicode{x2013}$Schulz iteration
di: Xiong, Xinhui, et al.
Pubblicazione: (2026)
di: Xiong, Xinhui, et al.
Pubblicazione: (2026)
Accelerating RLHF Training with Reward Variance Increase
di: Yang, Zonglin, et al.
Pubblicazione: (2025)
di: Yang, Zonglin, et al.
Pubblicazione: (2025)
Weighted Low-rank Approximation via Stochastic Gradient Descent on Manifolds
di: Xu, Conglong, et al.
Pubblicazione: (2025)
di: Xu, Conglong, et al.
Pubblicazione: (2025)
A Safe Screening Rule with Bi-level Optimization of $ν$ Support Vector Machine
di: Yang, Zhiji, et al.
Pubblicazione: (2024)
di: Yang, Zhiji, et al.
Pubblicazione: (2024)
Exploring the non-convexity in machine learning using quantum-inspired optimization
di: Kumar, Kandula Eswara Sai, et al.
Pubblicazione: (2026)
di: Kumar, Kandula Eswara Sai, et al.
Pubblicazione: (2026)
An improved column-generation-based matheuristic for learning classification trees
di: Patel, Krunal Kishor, et al.
Pubblicazione: (2023)
di: Patel, Krunal Kishor, et al.
Pubblicazione: (2023)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
di: Yang, Tong, et al.
Pubblicazione: (2026)
di: Yang, Tong, et al.
Pubblicazione: (2026)
Benchmarking PtO and PnO Methods in the Predictive Combinatorial Optimization Regime
di: Geng, Haoyu, et al.
Pubblicazione: (2023)
di: Geng, Haoyu, et al.
Pubblicazione: (2023)
Deep learning enhanced mixed integer optimization: Learning to reduce model dimensionality
di: Triantafyllou, Niki, et al.
Pubblicazione: (2024)
di: Triantafyllou, Niki, et al.
Pubblicazione: (2024)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
di: Li, Zihao, et al.
Pubblicazione: (2024)
di: Li, Zihao, et al.
Pubblicazione: (2024)
To Cool or not to Cool? Temperature Network Meets Large Foundation Models via DRO
di: Qiu, Zi-Hao, et al.
Pubblicazione: (2024)
di: Qiu, Zi-Hao, et al.
Pubblicazione: (2024)
Deep learning-driven scheduling algorithm for a single machine problem minimizing the total tardiness
di: Bouška, Michal, et al.
Pubblicazione: (2024)
di: Bouška, Michal, et al.
Pubblicazione: (2024)
Optimization over the intersection of manifolds
di: Yang, Yan, et al.
Pubblicazione: (2026)
di: Yang, Yan, et al.
Pubblicazione: (2026)
GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
A Theoretical Framework for Auxiliary-Loss-Free Load Balancing of Sparse Mixture-of-Experts in Large-Scale AI Models
di: Han, X. Y., et al.
Pubblicazione: (2025)
di: Han, X. Y., et al.
Pubblicazione: (2025)
Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control
di: Skifstad, Julian, et al.
Pubblicazione: (2026)
di: Skifstad, Julian, et al.
Pubblicazione: (2026)
Deep Reinforcement Learning for Traveling Purchaser Problems
di: Yuan, Haofeng, et al.
Pubblicazione: (2024)
di: Yuan, Haofeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A space-decoupling framework for optimization on bounded-rank matrices with orthogonally invariant constraints
di: Yang, Yan, et al.
Pubblicazione: (2025) -
LancBiO: dynamic Lanczos-aided bilevel optimization via Krylov subspace
di: Yang, Yan, et al.
Pubblicazione: (2024) -
Linear convergence of forward-backward accelerated algorithms without knowledge of the modulus of strong convexity
di: Li, Bowen, et al.
Pubblicazione: (2023) -
Double Momentum Method for Lower-Level Constrained Bilevel Optimization
di: Shi, Wanli, et al.
Pubblicazione: (2024) -
Convex and Bilevel Optimization for Neuro-Symbolic Inference and Learning
di: Dickens, Charles, et al.
Pubblicazione: (2024)