Contextual Bilevel Reinforcement Learning for Incentive Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Thoma, Vinzenz, Pasztor, Barna, Krause, Andreas, Ramponi, Giorgia, Hu, Yifan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Aligning Language Models from User Interactions
por: Buening, Thomas Kleine, et al.
Publicado: (2026)
por: Buening, Thomas Kleine, et al.
Publicado: (2026)
Convex and Bilevel Optimization for Neuro-Symbolic Inference and Learning
por: Dickens, Charles, et al.
Publicado: (2024)
por: Dickens, Charles, et al.
Publicado: (2024)
Riemannian Bilevel Optimization
por: Dutta, Sanchayan, et al.
Publicado: (2024)
por: Dutta, Sanchayan, et al.
Publicado: (2024)
On the Condition Number Dependency in Bilevel Optimization
por: Chen, Lesi, et al.
Publicado: (2025)
por: Chen, Lesi, et al.
Publicado: (2025)
Neur2BiLO: Neural Bilevel Optimization
por: Dumouchelle, Justin, et al.
Publicado: (2024)
por: Dumouchelle, Justin, et al.
Publicado: (2024)
Double Momentum Method for Lower-Level Constrained Bilevel Optimization
por: Shi, Wanli, et al.
Publicado: (2024)
por: Shi, Wanli, et al.
Publicado: (2024)
Hyperparameter Optimization for Driving Strategies Based on Reinforcement Learning
por: Adde, Nihal Acharya, et al.
Publicado: (2024)
por: Adde, Nihal Acharya, et al.
Publicado: (2024)
Bilevel Optimization over Saddle Points of Zero-Sum Markov Games
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis
por: Chen, Lesi, et al.
Publicado: (2023)
por: Chen, Lesi, et al.
Publicado: (2023)
Bilevel reinforcement learning via the development of hyper-gradient without lower-level convexity
por: Yang, Yan, et al.
Publicado: (2024)
por: Yang, Yan, et al.
Publicado: (2024)
Robust Evolutionary Multi-Objective Network Architecture Search for Reinforcement Learning (EMNAS-RL)
por: Adde, Nihal Acharya, et al.
Publicado: (2025)
por: Adde, Nihal Acharya, et al.
Publicado: (2025)
R2L: Reliable Reinforcement Learning: Guaranteed Return & Reliable Policies in Reinforcement Learning
por: Farhi, Nadir
Publicado: (2025)
por: Farhi, Nadir
Publicado: (2025)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
por: Yang, Tong, et al.
Publicado: (2026)
por: Yang, Tong, et al.
Publicado: (2026)
Deep Reinforcement Learning for Traveling Purchaser Problems
por: Yuan, Haofeng, et al.
Publicado: (2024)
por: Yuan, Haofeng, et al.
Publicado: (2024)
Bandits with Preference Feedback: A Stackelberg Game Perspective
por: Pásztor, Barna, et al.
Publicado: (2024)
por: Pásztor, Barna, et al.
Publicado: (2024)
Adaptive Primal-Dual Method for Safe Reinforcement Learning
por: Chen, Weiqin, et al.
Publicado: (2024)
por: Chen, Weiqin, et al.
Publicado: (2024)
Performative Policy Gradient: Optimality in Performative Reinforcement Learning
por: Basu, Debabrota, et al.
Publicado: (2025)
por: Basu, Debabrota, et al.
Publicado: (2025)
Reinforcement Learning for Multi-Truck Vehicle Routing Problems
por: Levin, Joshua, et al.
Publicado: (2022)
por: Levin, Joshua, et al.
Publicado: (2022)
Contextual Distributionally Robust Optimization with Causal and Continuous Structure: An Interpretable and Tractable Approach
por: Zhang, Fenglin, et al.
Publicado: (2026)
por: Zhang, Fenglin, et al.
Publicado: (2026)
Accelerating Cutting-Plane Algorithms via Reinforcement Learning Surrogates
por: Mana, Kyle, et al.
Publicado: (2023)
por: Mana, Kyle, et al.
Publicado: (2023)
Combining Reinforcement Learning and Optimal Transport for the Traveling Salesman Problem
por: Goh, Yong Liang, et al.
Publicado: (2022)
por: Goh, Yong Liang, et al.
Publicado: (2022)
Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and State
por: Cheng, Ziheng, et al.
Publicado: (2025)
por: Cheng, Ziheng, et al.
Publicado: (2025)
Faster Reinforcement Learning by Freezing Slow States
por: Wang, Yijia, et al.
Publicado: (2023)
por: Wang, Yijia, et al.
Publicado: (2023)
Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity
por: Amortila, Philip, et al.
Publicado: (2024)
por: Amortila, Philip, et al.
Publicado: (2024)
Temporal Difference Learning with Compressed Updates: Error-Feedback meets Reinforcement Learning
por: Mitra, Aritra, et al.
Publicado: (2023)
por: Mitra, Aritra, et al.
Publicado: (2023)
Policy Gradient Methods for Risk-Sensitive Distributional Reinforcement Learning with Provable Convergence
por: Xiao, Minheng, et al.
Publicado: (2024)
por: Xiao, Minheng, et al.
Publicado: (2024)
Deep Reinforcement Learning for Solving the Fleet Size and Mix Vehicle Routing Problem
por: Wan, Pengfu, et al.
Publicado: (2025)
por: Wan, Pengfu, et al.
Publicado: (2025)
Robust Reinforcement Learning in Finance: Modeling Market Impact with Elliptic Uncertainty Sets
por: Ma, Shaocong, et al.
Publicado: (2025)
por: Ma, Shaocong, et al.
Publicado: (2025)
Search-Optimized Quantization in Biomedical Ontology Alignment
por: Bouaggad, Oussama, et al.
Publicado: (2025)
por: Bouaggad, Oussama, et al.
Publicado: (2025)
Unsupervised Machine Learning Hybrid Approach Integrating Linear Programming in Loss Function: A Robust Optimization Technique
por: Kiruluta, Andrew, et al.
Publicado: (2024)
por: Kiruluta, Andrew, et al.
Publicado: (2024)
Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning
por: Ding, Jianglin, et al.
Publicado: (2025)
por: Ding, Jianglin, et al.
Publicado: (2025)
Solving Truly Massive Budgeted Monotonic POMDPs with Oracle-Guided Meta-Reinforcement Learning
por: Vora, Manav, et al.
Publicado: (2024)
por: Vora, Manav, et al.
Publicado: (2024)
Closing the Loop: Coordinating Inventory and Recommendation via Deep Reinforcement Learning on Multiple Timescales
por: Jiang, Jinyang, et al.
Publicado: (2025)
por: Jiang, Jinyang, et al.
Publicado: (2025)
DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty
por: Cui, Mingxuan, et al.
Publicado: (2025)
por: Cui, Mingxuan, et al.
Publicado: (2025)
Score as Action: Fine-Tuning Diffusion Generative Models by Continuous-time Reinforcement Learning
por: Zhao, Hanyang, et al.
Publicado: (2025)
por: Zhao, Hanyang, et al.
Publicado: (2025)
ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule
por: Huang, Yilie, et al.
Publicado: (2026)
por: Huang, Yilie, et al.
Publicado: (2026)
CORL: Reinforcement Learning of MILP Policies Solved via Branch and Bound
por: Anand, Akhil S, et al.
Publicado: (2025)
por: Anand, Akhil S, et al.
Publicado: (2025)
Classical and Deep Reinforcement Learning Inventory Control Policies for Pharmaceutical Supply Chains with Perishability and Non-Stationarity
por: Stranieri, Francesco, et al.
Publicado: (2025)
por: Stranieri, Francesco, et al.
Publicado: (2025)
Solving Integrated Process Planning and Scheduling Problem via Graph Neural Network Based Deep Reinforcement Learning
por: Li, Hongpei, et al.
Publicado: (2024)
por: Li, Hongpei, et al.
Publicado: (2024)
Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems
por: Huang, Yilie, et al.
Publicado: (2024)
por: Huang, Yilie, et al.
Publicado: (2024)
Ejemplares similares
-
Aligning Language Models from User Interactions
por: Buening, Thomas Kleine, et al.
Publicado: (2026) -
Convex and Bilevel Optimization for Neuro-Symbolic Inference and Learning
por: Dickens, Charles, et al.
Publicado: (2024) -
Riemannian Bilevel Optimization
por: Dutta, Sanchayan, et al.
Publicado: (2024) -
On the Condition Number Dependency in Bilevel Optimization
por: Chen, Lesi, et al.
Publicado: (2025) -
Neur2BiLO: Neural Bilevel Optimization
por: Dumouchelle, Justin, et al.
Publicado: (2024)