Deep RL With Information Constrained Policies: Generalization in Continuous Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malloy, Tailia, Sims, Chris R., Klinger, Tim, Liu, Miao, Riemer, Matthew, Tesauro, Gerald |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games
par: Malloy, Tailia, et autres
Publié: (2020)
par: Malloy, Tailia, et autres
Publié: (2020)
Learning in Factored Domains with Information-Constrained Visual Representations
par: Malloy, Tailia, et autres
Publié: (2023)
par: Malloy, Tailia, et autres
Publié: (2023)
Learning to Defend by Attacking (and Vice-Versa): Transfer of Learning in Cybersecurity Games
par: Malloy, Tailia, et autres
Publié: (2023)
par: Malloy, Tailia, et autres
Publié: (2023)
Assessing Spear-Phishing Website Generation in Large Language Model Coding Agents
par: Malloy, Tailia, et autres
Publié: (2026)
par: Malloy, Tailia, et autres
Publié: (2026)
On-line Policy Improvement using Monte-Carlo Search
par: Tesauro, Gerald, et autres
Publié: (2025)
par: Tesauro, Gerald, et autres
Publié: (2025)
Beyond Sliding Windows: Learning to Manage Memory in Non-Markovian Environments
par: Tasse, Geraud Nangue, et autres
Publié: (2025)
par: Tasse, Geraud Nangue, et autres
Publié: (2025)
The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models
par: Riemer, Matthew, et autres
Publié: (2025)
par: Riemer, Matthew, et autres
Publié: (2025)
Modeling Attention during Dimensional Shifts with Counterfactual and Delayed Feedback
par: Malloy, Tailia, et autres
Publié: (2025)
par: Malloy, Tailia, et autres
Publié: (2025)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
par: Huang, Luke J., et autres
Publié: (2026)
par: Huang, Luke J., et autres
Publié: (2026)
Enabling Realtime Reinforcement Learning at Scale with Staggered Asynchronous Inference
par: Riemer, Matthew, et autres
Publié: (2024)
par: Riemer, Matthew, et autres
Publié: (2024)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
par: Liu, Xiangyu, et autres
Publié: (2023)
par: Liu, Xiangyu, et autres
Publié: (2023)
What makes Models Compositional? A Theoretical View: With Supplement
par: Ram, Parikshit, et autres
Publié: (2024)
par: Ram, Parikshit, et autres
Publié: (2024)
Scalable Policy-Based RL Algorithms for POMDPs
par: Anjarlekar, Ameya, et autres
Publié: (2025)
par: Anjarlekar, Ameya, et autres
Publié: (2025)
Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models
par: Deproost, Senne, et autres
Publié: (2026)
par: Deproost, Senne, et autres
Publié: (2026)
SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies
par: Samadi, Amir, et autres
Publié: (2024)
par: Samadi, Amir, et autres
Publié: (2024)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
par: Mark, Max Sobol, et autres
Publié: (2024)
par: Mark, Max Sobol, et autres
Publié: (2024)
ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
par: He, Zelin, et autres
Publié: (2026)
par: He, Zelin, et autres
Publié: (2026)
Partial Policy Gradients for RL in LLMs
par: Mathur, Puneet, et autres
Publié: (2026)
par: Mathur, Puneet, et autres
Publié: (2026)
Categorical Policies: Multimodal Policy Learning and Exploration in Continuous Control
par: Islam, SM Mazharul, et autres
Publié: (2025)
par: Islam, SM Mazharul, et autres
Publié: (2025)
Ctrl-DNA: Controllable Cell-Type-Specific Regulatory DNA Design via Constrained RL
par: Chen, Xingyu, et autres
Publié: (2025)
par: Chen, Xingyu, et autres
Publié: (2025)
ControlTraj: Controllable Trajectory Generation with Topology-Constrained Diffusion Model
par: Zhu, Yuanshao, et autres
Publié: (2024)
par: Zhu, Yuanshao, et autres
Publié: (2024)
A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control
par: Choi, Wonhyeok, et autres
Publié: (2026)
par: Choi, Wonhyeok, et autres
Publié: (2026)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
par: Luo, Yu, et autres
Publié: (2024)
par: Luo, Yu, et autres
Publié: (2024)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
par: Mondal, Washim Uddin, et autres
Publié: (2024)
par: Mondal, Washim Uddin, et autres
Publié: (2024)
The Ultimate Test of Superintelligent AI Agents: Can an AI Balance Care and Control in Asymmetric Relationships?
par: Bouneffouf, Djallel, et autres
Publié: (2025)
par: Bouneffouf, Djallel, et autres
Publié: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
par: Cohen, Taco, et autres
Publié: (2025)
par: Cohen, Taco, et autres
Publié: (2025)
GRAM: Generalization in Deep RL with a Robust Adaptation Module
par: Queeney, James, et autres
Publié: (2024)
par: Queeney, James, et autres
Publié: (2024)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
par: Sancaktar, Cansu, et autres
Publié: (2026)
par: Sancaktar, Cansu, et autres
Publié: (2026)
Can We Optimize Deep RL Policy Weights as Trajectory Modeling?
par: Tang, Hongyao
Publié: (2025)
par: Tang, Hongyao
Publié: (2025)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
par: Fakoor, Rasool, et autres
Publié: (2026)
par: Fakoor, Rasool, et autres
Publié: (2026)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
par: Lee, Haanvid, et autres
Publié: (2024)
par: Lee, Haanvid, et autres
Publié: (2024)
Policy Learning for Off-Dynamics RL with Deficient Support
par: Van, Linh Le Pham, et autres
Publié: (2024)
par: Van, Linh Le Pham, et autres
Publié: (2024)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
Explainable RL Policies by Distilling to Locally-Specialized Linear Policies with Voronoi State Partitioning
par: Deproost, Senne, et autres
Publié: (2025)
par: Deproost, Senne, et autres
Publié: (2025)
Q-Guided Stein Variational Model Predictive Control via RL-informed Policy Prior
par: Cai, Shizhe, et autres
Publié: (2025)
par: Cai, Shizhe, et autres
Publié: (2025)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
par: Abbes, Istabrak, et autres
Publié: (2025)
par: Abbes, Istabrak, et autres
Publié: (2025)
Continual Learning as Computationally Constrained Reinforcement Learning
par: Kumar, Saurabh, et autres
Publié: (2023)
par: Kumar, Saurabh, et autres
Publié: (2023)
General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies
par: Wang, Jianxun, et autres
Publié: (2026)
par: Wang, Jianxun, et autres
Publié: (2026)
On Entropy Control in LLM-RL Algorithms
par: Shen, Han
Publié: (2025)
par: Shen, Han
Publié: (2025)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026)
par: Hatgis-Kessell, Stephane, et autres
Publié: (2026)
Documents similaires
-
Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games
par: Malloy, Tailia, et autres
Publié: (2020) -
Learning in Factored Domains with Information-Constrained Visual Representations
par: Malloy, Tailia, et autres
Publié: (2023) -
Learning to Defend by Attacking (and Vice-Versa): Transfer of Learning in Cybersecurity Games
par: Malloy, Tailia, et autres
Publié: (2023) -
Assessing Spear-Phishing Website Generation in Large Language Model Coding Agents
par: Malloy, Tailia, et autres
Publié: (2026) -
On-line Policy Improvement using Monte-Carlo Search
par: Tesauro, Gerald, et autres
Publié: (2025)