Sample-Efficient Policy Space Response Oracles with Joint Experience Best Response
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bighashdel, Ariyan, Simão, Thiago D., Oliehoek, Frans A. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Space Response Oracles: A Survey
par: Bighashdel, Ariyan, et autres
Publié: (2024)
par: Bighashdel, Ariyan, et autres
Publié: (2024)
Fusion-PSRO: Nash Policy Fusion for Policy Space Response Oracles
par: Lian, Jiesong, et autres
Publié: (2024)
par: Lian, Jiesong, et autres
Publié: (2024)
Uncoupled Learning of Differential Stackelberg Equilibria with Commitments
par: Loftin, Robert, et autres
Publié: (2023)
par: Loftin, Robert, et autres
Publié: (2023)
Inverse Concave-Utility Reinforcement Learning is Inverse Game Theory
par: Çelikok, Mustafa Mert, et autres
Publié: (2024)
par: Çelikok, Mustafa Mert, et autres
Publié: (2024)
Best Response Shaping
par: Aghajohari, Milad, et autres
Publié: (2024)
par: Aghajohari, Milad, et autres
Publié: (2024)
Ranking Joint Policies in Dynamic Games using Evolutionary Dynamics
par: Koliou, Natalia, et autres
Publié: (2025)
par: Koliou, Natalia, et autres
Publié: (2025)
Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience
par: Sayana, Krishna, et autres
Publié: (2026)
par: Sayana, Krishna, et autres
Publié: (2026)
Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning
par: Xu, Linjie, et autres
Publié: (2024)
par: Xu, Linjie, et autres
Publié: (2024)
Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models
par: Zhang, Yang, et autres
Publié: (2024)
par: Zhang, Yang, et autres
Publié: (2024)
Distributed Influence-Augmented Local Simulators for Parallel MARL in Large Networked Systems
par: Suau, Miguel, et autres
Publié: (2022)
par: Suau, Miguel, et autres
Publié: (2022)
Simulation-Free PSRO: Removing Game Simulation from Policy Space Response Oracles
par: Liu, Yingzhuo, et autres
Publié: (2025)
par: Liu, Yingzhuo, et autres
Publié: (2025)
Difference Rewards Policy Gradients
par: Castellini, Jacopo, et autres
Publié: (2020)
par: Castellini, Jacopo, et autres
Publié: (2020)
GT-Space: Enhancing Heterogeneous Collaborative Perception with Ground Truth Feature Space
par: Wang, Wentao, et autres
Publié: (2026)
par: Wang, Wentao, et autres
Publié: (2026)
Value-Based Rationales Improve Social Experience: A Multiagent Simulation Study
par: Tzeng, Sz-Ting, et autres
Publié: (2024)
par: Tzeng, Sz-Ting, et autres
Publié: (2024)
Fairness for Workers Who Pull the Arms: An Index Based Policy for Allocation of Restless Bandit Tasks
par: Biswas, Arpita, et autres
Publié: (2023)
par: Biswas, Arpita, et autres
Publié: (2023)
Enabling Agents to Communicate Entirely in Latent Space
par: Du, Zhuoyun, et autres
Publié: (2025)
par: Du, Zhuoyun, et autres
Publié: (2025)
Scalable Submodular Policy Optimization via Pruned Submodularity Graph
par: Anand, Aditi, et autres
Publié: (2025)
par: Anand, Aditi, et autres
Publié: (2025)
Descent-Guided Policy Gradient for Scalable Cooperative Multi-Agent Learning
par: Yang, Shan, et autres
Publié: (2026)
par: Yang, Shan, et autres
Publié: (2026)
Network-Constrained Policy Optimization for Adaptive Multi-agent Vehicle Routing
par: Arasteh, Fazel, et autres
Publié: (2025)
par: Arasteh, Fazel, et autres
Publié: (2025)
Centralized Permutation Equivariant Policy for Cooperative Multi-Agent Reinforcement Learning
par: Xu, Zhuofan, et autres
Publié: (2025)
par: Xu, Zhuofan, et autres
Publié: (2025)
The Yokai Learning Environment: Tracking Beliefs Over Space and Time
par: Ruhdorfer, Constantin, et autres
Publié: (2025)
par: Ruhdorfer, Constantin, et autres
Publié: (2025)
Deep Reinforcement Learning Agents for Strategic Production Policies in Microeconomic Market Simulations
par: Garrido-Merchán, Eduardo C., et autres
Publié: (2024)
par: Garrido-Merchán, Eduardo C., et autres
Publié: (2024)
Peer Learning: Learning Complex Policies in Groups from Scratch via Action Recommendations
par: Derstroff, Cedric, et autres
Publié: (2023)
par: Derstroff, Cedric, et autres
Publié: (2023)
ToMCAT: Theory-of-Mind for Cooperative Agents in Teams via Multiagent Diffusion Policies
par: Sequeira, Pedro, et autres
Publié: (2025)
par: Sequeira, Pedro, et autres
Publié: (2025)
Efficient Multi-agent Reinforcement Learning by Planning
par: Liu, Qihan, et autres
Publié: (2024)
par: Liu, Qihan, et autres
Publié: (2024)
MESA: Cooperative Meta-Exploration in Multi-Agent Learning through Exploiting State-Action Space Structure
par: Zhang, Zhicheng, et autres
Publié: (2024)
par: Zhang, Zhicheng, et autres
Publié: (2024)
Efficient support ticket resolution using Knowledge Graphs
par: Varghese, Sherwin, et autres
Publié: (2024)
par: Varghese, Sherwin, et autres
Publié: (2024)
Sable: a Performant, Efficient and Scalable Sequence Model for MARL
par: Mahjoub, Omayma, et autres
Publié: (2024)
par: Mahjoub, Omayma, et autres
Publié: (2024)
Representation Learning For Efficient Deep Multi-Agent Reinforcement Learning
par: Huh, Dom, et autres
Publié: (2024)
par: Huh, Dom, et autres
Publié: (2024)
Episodic Memory in Agentic Frameworks: Suggesting Next Tasks
par: Fiorini, Sandro Rama, et autres
Publié: (2025)
par: Fiorini, Sandro Rama, et autres
Publié: (2025)
Hierarchical LLM-Driven Control for HAPS-Assisted UAV Networks: Joint Optimization of Flight and Connectivity
par: Yan, Zijiang, et autres
Publié: (2026)
par: Yan, Zijiang, et autres
Publié: (2026)
KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
par: Shi, Xiangyu, et autres
Publié: (2025)
par: Shi, Xiangyu, et autres
Publié: (2025)
Selectively Sharing Experiences Improves Multi-Agent Reinforcement Learning
par: Gerstgrasser, Matthias, et autres
Publié: (2023)
par: Gerstgrasser, Matthias, et autres
Publié: (2023)
NeuroMAS: Multi-Agent Systems as Neural Networks with Joint Reinforcement Learning
par: Lu, Haoran, et autres
Publié: (2026)
par: Lu, Haoran, et autres
Publié: (2026)
Planner Matters! An Efficient and Unbalanced Multi-agent Collaboration Framework for Long-horizon Planning
par: Wu, Wenyi, et autres
Publié: (2026)
par: Wu, Wenyi, et autres
Publié: (2026)
KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
par: Ye, Hancheng, et autres
Publié: (2025)
par: Ye, Hancheng, et autres
Publié: (2025)
Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation
par: Wu, Xiangfan
Publié: (2025)
par: Wu, Xiangfan
Publié: (2025)
Beyond Shallow Behavior: Task-Efficient Value-Based Multi-Task Offline MARL via Skill Discovery
par: Wang, Xun, et autres
Publié: (2025)
par: Wang, Xun, et autres
Publié: (2025)
Ensembling Prioritized Hybrid Policies for Multi-agent Pathfinding
par: Tang, Huijie, et autres
Publié: (2024)
par: Tang, Huijie, et autres
Publié: (2024)
CoMIX: A Multi-agent Reinforcement Learning Training Architecture for Efficient Decentralized Coordination and Independent Decision-Making
par: Minelli, Giovanni, et autres
Publié: (2023)
par: Minelli, Giovanni, et autres
Publié: (2023)
Documents similaires
-
Policy Space Response Oracles: A Survey
par: Bighashdel, Ariyan, et autres
Publié: (2024) -
Fusion-PSRO: Nash Policy Fusion for Policy Space Response Oracles
par: Lian, Jiesong, et autres
Publié: (2024) -
Uncoupled Learning of Differential Stackelberg Equilibria with Commitments
par: Loftin, Robert, et autres
Publié: (2023) -
Inverse Concave-Utility Reinforcement Learning is Inverse Game Theory
par: Çelikok, Mustafa Mert, et autres
Publié: (2024) -
Best Response Shaping
par: Aghajohari, Milad, et autres
Publié: (2024)