Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malloy, Tailia, Klinger, Tim, Liu, Miao, Riemer, Matthew, Tesauro, Gerald, Sims, Chris R. |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deep RL With Information Constrained Policies: Generalization in Continuous Control
par: Malloy, Tailia, et autres
Publié: (2020)
par: Malloy, Tailia, et autres
Publié: (2020)
Learning in Factored Domains with Information-Constrained Visual Representations
par: Malloy, Tailia, et autres
Publié: (2023)
par: Malloy, Tailia, et autres
Publié: (2023)
Learning to Defend by Attacking (and Vice-Versa): Transfer of Learning in Cybersecurity Games
par: Malloy, Tailia, et autres
Publié: (2023)
par: Malloy, Tailia, et autres
Publié: (2023)
Assessing Spear-Phishing Website Generation in Large Language Model Coding Agents
par: Malloy, Tailia, et autres
Publié: (2026)
par: Malloy, Tailia, et autres
Publié: (2026)
On-line Policy Improvement using Monte-Carlo Search
par: Tesauro, Gerald, et autres
Publié: (2025)
par: Tesauro, Gerald, et autres
Publié: (2025)
Beyond Sliding Windows: Learning to Manage Memory in Non-Markovian Environments
par: Tasse, Geraud Nangue, et autres
Publié: (2025)
par: Tasse, Geraud Nangue, et autres
Publié: (2025)
Zero Knowledge Games
par: Malloy, Ian
Publié: (2020)
par: Malloy, Ian
Publié: (2020)
Modeling Attention during Dimensional Shifts with Counterfactual and Delayed Feedback
par: Malloy, Tailia, et autres
Publié: (2025)
par: Malloy, Tailia, et autres
Publié: (2025)
The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models
par: Riemer, Matthew, et autres
Publié: (2025)
par: Riemer, Matthew, et autres
Publié: (2025)
The Ultimate Test of Superintelligent AI Agents: Can an AI Balance Care and Control in Asymmetric Relationships?
par: Bouneffouf, Djallel, et autres
Publié: (2025)
par: Bouneffouf, Djallel, et autres
Publié: (2025)
Exploring Information Seeking Agent Consolidation
par: Yan, Guochen, et autres
Publié: (2026)
par: Yan, Guochen, et autres
Publié: (2026)
Training Users Against Human and GPT-4 Generated Social Engineering Attacks
par: Malloy, Tailia, et autres
Publié: (2025)
par: Malloy, Tailia, et autres
Publié: (2025)
Leveraging a Cognitive Model to Measure Subjective Similarity of Human and GPT-4 Written Content
par: Malloy, Tailia, et autres
Publié: (2024)
par: Malloy, Tailia, et autres
Publié: (2024)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
par: Zhao, Yang, et autres
Publié: (2026)
par: Zhao, Yang, et autres
Publié: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
par: Cao, Shiyi, et autres
Publié: (2025)
par: Cao, Shiyi, et autres
Publié: (2025)
One Policy, Infinite NPCs: Persona-Traceable Shared RL Policies for Scalable Game Agents
par: Hong, Yoosung
Publié: (2026)
par: Hong, Yoosung
Publié: (2026)
Multi-Agent Path Finding via Offline RL and LLM Collaboration
par: Atasever, Merve, et autres
Publié: (2025)
par: Atasever, Merve, et autres
Publié: (2025)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
par: Yao, Yi, et autres
Publié: (2026)
par: Yao, Yi, et autres
Publié: (2026)
Safe Heterogeneous Multi-Agent RL with Communication Regularization for Coordinated Target Acquisition
par: Calzolari, Gabriele, et autres
Publié: (2026)
par: Calzolari, Gabriele, et autres
Publié: (2026)
The Role of Deep Learning Regularizations on Actors in Offline RL
par: Tarasov, Denis, et autres
Publié: (2024)
par: Tarasov, Denis, et autres
Publié: (2024)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
Robust Multi-Agent Reinforcement Learning by Mutual Information Regularization
par: Li, Simin, et autres
Publié: (2023)
par: Li, Simin, et autres
Publié: (2023)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
par: Li, Weizhen, et autres
Publié: (2025)
par: Li, Weizhen, et autres
Publié: (2025)
Learning to Beat ByteRL: Exploitability of Collectible Card Game Agents
par: Haluska, Radovan, et autres
Publié: (2024)
par: Haluska, Radovan, et autres
Publié: (2024)
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
par: Xin, Ran, et autres
Publié: (2025)
par: Xin, Ran, et autres
Publié: (2025)
JaxMARL: Multi-Agent RL Environments and Algorithms in JAX
par: Rutherford, Alexander, et autres
Publié: (2023)
par: Rutherford, Alexander, et autres
Publié: (2023)
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Style-Preserving Policy Optimization for Game Agents
par: Li, Lingfeng, et autres
Publié: (2025)
par: Li, Lingfeng, et autres
Publié: (2025)
Position: Theory of Mind Benchmarks are Broken for Large Language Models
par: Riemer, Matthew, et autres
Publié: (2024)
par: Riemer, Matthew, et autres
Publié: (2024)
Cooperative Game-Theoretic Credit Assignment for Multi-Agent Policy Gradients via the Core
par: Ji, Mengda, et autres
Publié: (2025)
par: Ji, Mengda, et autres
Publié: (2025)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
par: Liu, Shulin, et autres
Publié: (2025)
par: Liu, Shulin, et autres
Publié: (2025)
Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RL
par: Huang, Jiawei, et autres
Publié: (2024)
par: Huang, Jiawei, et autres
Publié: (2024)
A Neuro-Symbolic Approach to Multi-Agent RL for Interpretability and Probabilistic Decision Making
par: Subramanian, Chitra, et autres
Publié: (2024)
par: Subramanian, Chitra, et autres
Publié: (2024)
DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
par: Xie, Yaqi, et autres
Publié: (2026)
par: Xie, Yaqi, et autres
Publié: (2026)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
par: Zeng, Yifan, et autres
Publié: (2026)
par: Zeng, Yifan, et autres
Publié: (2026)
Human-Agent Coordination in Games under Incomplete Information via Multi-Step Intent
par: Chen, Shenghui, et autres
Publié: (2024)
par: Chen, Shenghui, et autres
Publié: (2024)
MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models
par: Liao, Zhaokang, et autres
Publié: (2026)
par: Liao, Zhaokang, et autres
Publié: (2026)
A Sentiment Consolidation Framework for Meta-Review Generation
par: Li, Miao, et autres
Publié: (2024)
par: Li, Miao, et autres
Publié: (2024)
Matryoshka Policy Gradient for Entropy-Regularized RL: Convergence and Global Optimality
par: Ged, François, et autres
Publié: (2023)
par: Ged, François, et autres
Publié: (2023)
Enabling Realtime Reinforcement Learning at Scale with Staggered Asynchronous Inference
par: Riemer, Matthew, et autres
Publié: (2024)
par: Riemer, Matthew, et autres
Publié: (2024)
Documents similaires
-
Deep RL With Information Constrained Policies: Generalization in Continuous Control
par: Malloy, Tailia, et autres
Publié: (2020) -
Learning in Factored Domains with Information-Constrained Visual Representations
par: Malloy, Tailia, et autres
Publié: (2023) -
Learning to Defend by Attacking (and Vice-Versa): Transfer of Learning in Cybersecurity Games
par: Malloy, Tailia, et autres
Publié: (2023) -
Assessing Spear-Phishing Website Generation in Large Language Model Coding Agents
par: Malloy, Tailia, et autres
Publié: (2026) -
On-line Policy Improvement using Monte-Carlo Search
par: Tesauro, Gerald, et autres
Publié: (2025)