Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Patel, Shrenik, Truong, Christine |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DoubleTake: Contrastive Reasoning for Faithful Decision-Making in Medical Imaging
di: Patel, Daivik, et al.
Pubblicazione: (2026)
di: Patel, Daivik, et al.
Pubblicazione: (2026)
FairMarket-RL: LLM-Guided Fairness Shaping for Multi-Agent Reinforcement Learning in Peer-to-Peer Markets
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025)
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025)
M3PO: Massively Multi-Task Model-Based Policy Optimization
di: Narendra, Aditya, et al.
Pubblicazione: (2025)
di: Narendra, Aditya, et al.
Pubblicazione: (2025)
Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)
Co-Optimizing Reconfigurable Environments and Policies for Decentralized Multi-Agent Navigation
di: Gao, Zhan, et al.
Pubblicazione: (2024)
di: Gao, Zhan, et al.
Pubblicazione: (2024)
Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
di: Alon, Yoav, et al.
Pubblicazione: (2020)
di: Alon, Yoav, et al.
Pubblicazione: (2020)
RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization
di: Xia, Linxuan, et al.
Pubblicazione: (2026)
di: Xia, Linxuan, et al.
Pubblicazione: (2026)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
di: Si, Wenwen, et al.
Pubblicazione: (2025)
di: Si, Wenwen, et al.
Pubblicazione: (2025)
Deep RL With Information Constrained Policies: Generalization in Continuous Control
di: Malloy, Tailia, et al.
Pubblicazione: (2020)
di: Malloy, Tailia, et al.
Pubblicazione: (2020)
CODA: Coordination via On-Policy Diffusion for Multi-Agent Offline Reinforcement Learning
di: Hedman, Marcel, et al.
Pubblicazione: (2026)
di: Hedman, Marcel, et al.
Pubblicazione: (2026)
OPTIMA: Optimized Policy for Intelligent Multi-Agent Systems Enables Coordination-Aware Autonomous Vehicles
di: Du, Rui, et al.
Pubblicazione: (2024)
di: Du, Rui, et al.
Pubblicazione: (2024)
Bayesian Calibration of Engine-out NOx Models for Engine-to-Engine Transferability
di: Zinage, Shrenik, et al.
Pubblicazione: (2025)
di: Zinage, Shrenik, et al.
Pubblicazione: (2025)
DKL-KAN: Scalable Deep Kernel Learning using Kolmogorov-Arnold Networks
di: Zinage, Shrenik, et al.
Pubblicazione: (2024)
di: Zinage, Shrenik, et al.
Pubblicazione: (2024)
A Causal Graph-Enhanced Gaussian Process Regression for Modeling Engine-out NOx
di: Zinage, Shrenik, et al.
Pubblicazione: (2024)
di: Zinage, Shrenik, et al.
Pubblicazione: (2024)
HUANet: Hard-Constrained Unrolled ADMM for Constrained Convex Optimization
di: Tran, Trinh, et al.
Pubblicazione: (2026)
di: Tran, Trinh, et al.
Pubblicazione: (2026)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Scalable Fairness Shaping with LLM-Guided Multi-Agent Reinforcement Learning for Peer-to-Peer Electricity Markets
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
Capacity-Aware Planning and Scheduling in Budget-Constrained Multi-Agent MDPs: A Meta-RL Approach
di: Vora, Manav, et al.
Pubblicazione: (2024)
di: Vora, Manav, et al.
Pubblicazione: (2024)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
State-wise Constrained Policy Optimization
di: Zhao, Weiye, et al.
Pubblicazione: (2023)
di: Zhao, Weiye, et al.
Pubblicazione: (2023)
e-COP : Episodic Constrained Optimization of Policies
di: Agnihotri, Akhil, et al.
Pubblicazione: (2024)
di: Agnihotri, Akhil, et al.
Pubblicazione: (2024)
Proactive Constrained Policy Optimization with Preemptive Penalty
di: Yang, Ning, et al.
Pubblicazione: (2025)
di: Yang, Ning, et al.
Pubblicazione: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)
di: Cohen, Taco, et al.
Pubblicazione: (2025)
Inference Time Policy Optimization for Offline RL with Differentiable World Models
di: Deb, Rohan, et al.
Pubblicazione: (2026)
di: Deb, Rohan, et al.
Pubblicazione: (2026)
Centralized Adaptive Sampling for Reliable Co-Training of Independent Multi-Agent Policies
di: Corrado, Nicholas E., et al.
Pubblicazione: (2025)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2025)
Constrained Policy Optimization with Cantelli-Bounded Value-at-Risk
di: Tangri, Rohan, et al.
Pubblicazione: (2026)
di: Tangri, Rohan, et al.
Pubblicazione: (2026)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
Robustifying a Policy in Multi-Agent RL with Diverse Cooperative Behaviors and Adversarial Style Sampling for Assistive Tasks
di: Osa, Takayuki, et al.
Pubblicazione: (2024)
di: Osa, Takayuki, et al.
Pubblicazione: (2024)
Ready from Day 1: Population-Aware Coordination for Large-Scale Constrained Multi-Agent Systems
di: Wang, Angel, et al.
Pubblicazione: (2026)
di: Wang, Angel, et al.
Pubblicazione: (2026)
COMPASS: Benchmarking Constrained Optimization in LLM Agents
di: Qin, Tian, et al.
Pubblicazione: (2025)
di: Qin, Tian, et al.
Pubblicazione: (2025)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
di: Zeng, Yifan, et al.
Pubblicazione: (2026)
di: Zeng, Yifan, et al.
Pubblicazione: (2026)
DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
di: Li, Xiaofan, et al.
Pubblicazione: (2026)
di: Li, Xiaofan, et al.
Pubblicazione: (2026)
Action-Graph Policies: Learning Action Co-dependencies in Multi-Agent Reinforcement Learning
di: Gupta, Nikunj, et al.
Pubblicazione: (2026)
di: Gupta, Nikunj, et al.
Pubblicazione: (2026)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2026)
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2026)
Streetwise Agents: Empowering Offline RL Policies to Outsmart Exogenous Stochastic Disturbances in RTC
di: Soni, Aditya, et al.
Pubblicazione: (2024)
di: Soni, Aditya, et al.
Pubblicazione: (2024)
Constrained Group Relative Policy Optimization
di: Girgis, Roger, et al.
Pubblicazione: (2026)
di: Girgis, Roger, et al.
Pubblicazione: (2026)
Effective Policy Learning for Multi-Agent Online Coordination Beyond Submodular Objectives
di: Zhang, Qixin, et al.
Pubblicazione: (2025)
di: Zhang, Qixin, et al.
Pubblicazione: (2025)
Autoregressive Policy Optimization for Constrained Allocation Tasks
di: Winkel, David, et al.
Pubblicazione: (2024)
di: Winkel, David, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DoubleTake: Contrastive Reasoning for Faithful Decision-Making in Medical Imaging
di: Patel, Daivik, et al.
Pubblicazione: (2026) -
FairMarket-RL: LLM-Guided Fairness Shaping for Multi-Agent Reinforcement Learning in Peer-to-Peer Markets
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025) -
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
di: Bhansali, Shrenik, et al.
Pubblicazione: (2025) -
M3PO: Massively Multi-Task Model-Based Policy Optimization
di: Narendra, Aditya, et al.
Pubblicazione: (2025) -
Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)