Scalable Multi-Agent Offline Reinforcement Learning and the Role of Information
Fuente:
arXiv
Salvato in:
| Autori principali: | Zamboni, Riccardo, Brunetti, Enrico, Restelli, Marcello |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Principled Unsupervised Multi-Agent Reinforcement Learning
di: Zamboni, Riccardo, et al.
Pubblicazione: (2025)
di: Zamboni, Riccardo, et al.
Pubblicazione: (2025)
Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
di: De Paola, Vincenzo, et al.
Pubblicazione: (2025)
di: De Paola, Vincenzo, et al.
Pubblicazione: (2025)
The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
di: Tenedini, Davide, et al.
Pubblicazione: (2025)
di: Tenedini, Davide, et al.
Pubblicazione: (2025)
How to Explore with Belief: State Entropy Maximization in POMDPs
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)
K-Myriad: Jump-starting reinforcement learning with unsupervised parallel agents
di: De Paola, Vincenzo, et al.
Pubblicazione: (2026)
di: De Paola, Vincenzo, et al.
Pubblicazione: (2026)
Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching
di: Fraschini, Andrea, et al.
Pubblicazione: (2026)
di: Fraschini, Andrea, et al.
Pubblicazione: (2026)
CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning
di: Hedman, Marcel, et al.
Pubblicazione: (2026)
di: Hedman, Marcel, et al.
Pubblicazione: (2026)
Inverse Reinforcement Learning with Sub-optimal Experts
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Exploiting Causal Graph Priors with Posterior Sampling for Reinforcement Learning
di: Mutti, Mirco, et al.
Pubblicazione: (2023)
di: Mutti, Mirco, et al.
Pubblicazione: (2023)
"So, Tell Me About Your Policy...": Distillation of interpretable policies from Deep Reinforcement Learning agents
di: Dispoto, Giovanni, et al.
Pubblicazione: (2025)
di: Dispoto, Giovanni, et al.
Pubblicazione: (2025)
Building surrogate models using trajectories of agents trained by Reinforcement Learning
di: Cestero, Julen, et al.
Pubblicazione: (2025)
di: Cestero, Julen, et al.
Pubblicazione: (2025)
Sharing Knowledge in Multi-Task Deep Reinforcement Learning
di: D'Eramo, Carlo, et al.
Pubblicazione: (2024)
di: D'Eramo, Carlo, et al.
Pubblicazione: (2024)
Pure Exploration under Mediators' Feedback
di: Poiani, Riccardo, et al.
Pubblicazione: (2023)
di: Poiani, Riccardo, et al.
Pubblicazione: (2023)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
di: Bonetti, Paolo, et al.
Pubblicazione: (2024)
di: Bonetti, Paolo, et al.
Pubblicazione: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
A Reinforcement Learning Approach for Optimal Control in Microgrids
di: Salaorni, Davide, et al.
Pubblicazione: (2025)
di: Salaorni, Davide, et al.
Pubblicazione: (2025)
Optimal Multi-Fidelity Best-Arm Identification
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Online Dynamic Pricing of Complementary Products
di: Mussi, Marco, et al.
Pubblicazione: (2025)
di: Mussi, Marco, et al.
Pubblicazione: (2025)
Online Market Making and the Value of Observing the Order Book
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Finite Sample Bounds for Non-Parametric Regression: Optimal Sample Efficiency and Space Complexity
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Learning in Markov Decision Processes with Exogenous Dynamics
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
di: Fabrizio, Carlo, et al.
Pubblicazione: (2025)
di: Fabrizio, Carlo, et al.
Pubblicazione: (2025)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
di: Russo, Alessio, et al.
Pubblicazione: (2024)
di: Russo, Alessio, et al.
Pubblicazione: (2024)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
di: Drappo, Gianluca, et al.
Pubblicazione: (2024)
di: Drappo, Gianluca, et al.
Pubblicazione: (2024)
Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning
di: Pang, Teng, et al.
Pubblicazione: (2026)
di: Pang, Teng, et al.
Pubblicazione: (2026)
Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
di: Oh, Jihwan, et al.
Pubblicazione: (2024)
di: Oh, Jihwan, et al.
Pubblicazione: (2024)
Conservative and Risk-Aware Offline Multi-Agent Reinforcement Learning
di: Eldeeb, Eslam, et al.
Pubblicazione: (2024)
di: Eldeeb, Eslam, et al.
Pubblicazione: (2024)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
di: Eldowa, Khaled, et al.
Pubblicazione: (2024)
di: Eldowa, Khaled, et al.
Pubblicazione: (2024)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
How Log-Barrier Helps Exploration in Policy Optimization
di: Cesani, Leonardo, et al.
Pubblicazione: (2026)
di: Cesani, Leonardo, et al.
Pubblicazione: (2026)
Scalable Offline Reinforcement Learning for Mean Field Games
di: Brunnbauer, Axel, et al.
Pubblicazione: (2024)
di: Brunnbauer, Axel, et al.
Pubblicazione: (2024)
Optimizing Energy Management of Smart Grid using Reinforcement Learning aided by Surrogate models built using Physics-informed Neural Networks
di: Cestero, Julen, et al.
Pubblicazione: (2025)
di: Cestero, Julen, et al.
Pubblicazione: (2025)
An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management
di: Eldeeb, Eslam, et al.
Pubblicazione: (2025)
di: Eldeeb, Eslam, et al.
Pubblicazione: (2025)
Selective Reincarnation: Offline-to-Online Multi-Agent Reinforcement Learning
di: Formanek, Claude, et al.
Pubblicazione: (2023)
di: Formanek, Claude, et al.
Pubblicazione: (2023)
Putting Data at the Centre of Offline Multi-Agent Reinforcement Learning
di: Formanek, Claude, et al.
Pubblicazione: (2024)
di: Formanek, Claude, et al.
Pubblicazione: (2024)
B3C: A Minimalist Approach to Offline Multi-Agent Reinforcement Learning
di: Kim, Woojun, et al.
Pubblicazione: (2025)
di: Kim, Woojun, et al.
Pubblicazione: (2025)
Information-Directed Offline-to-Online Reinforcement Learning
di: Chen, Keru
Pubblicazione: (2026)
di: Chen, Keru
Pubblicazione: (2026)
Documenti analoghi
-
Towards Principled Unsupervised Multi-Agent Reinforcement Learning
di: Zamboni, Riccardo, et al.
Pubblicazione: (2025) -
Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
di: De Paola, Vincenzo, et al.
Pubblicazione: (2025) -
The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024) -
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
di: Tenedini, Davide, et al.
Pubblicazione: (2025) -
How to Explore with Belief: State Entropy Maximization in POMDPs
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)