Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Zongkai, Lin, Qian, Yu, Chao, Wu, Xiawei, Liang, Yile, Li, Donghui, Ding, Xuetao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Policy-regularized Offline Multi-objective Reinforcement Learning
von: Lin, Qian, et al.
Veröffentlicht: (2024)
von: Lin, Qian, et al.
Veröffentlicht: (2024)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
von: Lin, Qian, et al.
Veröffentlicht: (2024)
von: Lin, Qian, et al.
Veröffentlicht: (2024)
Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration
von: Zhong, Hai, et al.
Veröffentlicht: (2024)
von: Zhong, Hai, et al.
Veröffentlicht: (2024)
Offline Policy Optimization with Posterior Sampling
von: Lin, Hongqiang, et al.
Veröffentlicht: (2026)
von: Lin, Hongqiang, et al.
Veröffentlicht: (2026)
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
von: Liang, Yile, et al.
Veröffentlicht: (2024)
von: Liang, Yile, et al.
Veröffentlicht: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2025)
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
When is Offline Policy Selection Sample Efficient for Reinforcement Learning?
von: Liu, Vincent, et al.
Veröffentlicht: (2023)
von: Liu, Vincent, et al.
Veröffentlicht: (2023)
IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning
von: Qin, Yihao, et al.
Veröffentlicht: (2026)
von: Qin, Yihao, et al.
Veröffentlicht: (2026)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Policy Expansion for Bridging Offline-to-Online Reinforcement Learning
von: Zhang, Haichao, et al.
Veröffentlicht: (2023)
von: Zhang, Haichao, et al.
Veröffentlicht: (2023)
Safe Offline Reinforcement Learning with Real-Time Budget Constraints
von: Lin, Qian, et al.
Veröffentlicht: (2023)
von: Lin, Qian, et al.
Veröffentlicht: (2023)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
RUMAD: Reinforcement-Unifying Multi-Agent Debate
von: Wang, Chao, et al.
Veröffentlicht: (2026)
von: Wang, Chao, et al.
Veröffentlicht: (2026)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
von: Hu, Jifeng, et al.
Veröffentlicht: (2025)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization
von: Chen, Yifei, et al.
Veröffentlicht: (2026)
von: Chen, Yifei, et al.
Veröffentlicht: (2026)
Offline Multi-Objective Optimization
von: Xue, Ke, et al.
Veröffentlicht: (2024)
von: Xue, Ke, et al.
Veröffentlicht: (2024)
Pessimistic Auxiliary Policy for Offline Reinforcement Learning
von: Zhang, Fan, et al.
Veröffentlicht: (2026)
von: Zhang, Fan, et al.
Veröffentlicht: (2026)
QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning
von: Kong, Yilun, et al.
Veröffentlicht: (2024)
von: Kong, Yilun, et al.
Veröffentlicht: (2024)
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
von: Liu, Zongkai, et al.
Veröffentlicht: (2025)
von: Liu, Zongkai, et al.
Veröffentlicht: (2025)
LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
von: Chen, Xudong, et al.
Veröffentlicht: (2026)
von: Chen, Xudong, et al.
Veröffentlicht: (2026)
Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization
von: Xu, Zelai, et al.
Veröffentlicht: (2025)
von: Xu, Zelai, et al.
Veröffentlicht: (2025)
Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
von: Hu, Zican, et al.
Veröffentlicht: (2025)
von: Hu, Zican, et al.
Veröffentlicht: (2025)
Policy Constraint by Only Support Constraint for Offline Reinforcement Learning
von: Gao, Yunkai, et al.
Veröffentlicht: (2025)
von: Gao, Yunkai, et al.
Veröffentlicht: (2025)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
von: Madhow, Sunil, et al.
Veröffentlicht: (2023)
von: Madhow, Sunil, et al.
Veröffentlicht: (2023)
AdapTraj: A Multi-Source Domain Generalization Framework for Multi-Agent Trajectory Prediction
von: Qian, Tangwen, et al.
Veröffentlicht: (2023)
von: Qian, Tangwen, et al.
Veröffentlicht: (2023)
Offline Reinforcement Learning with Generative Trajectory Policies
von: Feng, Xinsong, et al.
Veröffentlicht: (2025)
von: Feng, Xinsong, et al.
Veröffentlicht: (2025)
Collapsing Sequence-Level Data-Policy Coverage via Poisoning Attack in Offline Reinforcement Learning
von: Zhou, Xue, et al.
Veröffentlicht: (2025)
von: Zhou, Xue, et al.
Veröffentlicht: (2025)
Coevolving with the Other You: Fine-Tuning LLM with Sequential Cooperative Multi-Agent Reinforcement Learning
von: Ma, Hao, et al.
Veröffentlicht: (2024)
von: Ma, Hao, et al.
Veröffentlicht: (2024)
SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning
von: Xu, Zhongling, et al.
Veröffentlicht: (2026)
von: Xu, Zhongling, et al.
Veröffentlicht: (2026)
Selective Reincarnation: Offline-to-Online Multi-Agent Reinforcement Learning
von: Formanek, Claude, et al.
Veröffentlicht: (2023)
von: Formanek, Claude, et al.
Veröffentlicht: (2023)
Putting Data at the Centre of Offline Multi-Agent Reinforcement Learning
von: Formanek, Claude, et al.
Veröffentlicht: (2024)
von: Formanek, Claude, et al.
Veröffentlicht: (2024)
Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision
von: Zhang, Shilin, et al.
Veröffentlicht: (2025)
von: Zhang, Shilin, et al.
Veröffentlicht: (2025)
Explaining Decentralized Multi-Agent Reinforcement Learning Policies
von: Boggess, Kayla, et al.
Veröffentlicht: (2025)
von: Boggess, Kayla, et al.
Veröffentlicht: (2025)
PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering
von: Liu, Yu, et al.
Veröffentlicht: (2026)
von: Liu, Yu, et al.
Veröffentlicht: (2026)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
von: Hu, Hao, et al.
Veröffentlicht: (2025)
von: Hu, Hao, et al.
Veröffentlicht: (2025)
Evaluation-Time Policy Switching for Offline Reinforcement Learning
von: Neggatu, Natinael Solomon, et al.
Veröffentlicht: (2025)
von: Neggatu, Natinael Solomon, et al.
Veröffentlicht: (2025)
Sample Efficient Active Algorithms for Offline Reinforcement Learning
von: Roy, Soumyadeep, et al.
Veröffentlicht: (2026)
von: Roy, Soumyadeep, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Policy-regularized Offline Multi-objective Reinforcement Learning
von: Lin, Qian, et al.
Veröffentlicht: (2024) -
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
von: Lin, Qian, et al.
Veröffentlicht: (2024) -
Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration
von: Zhong, Hai, et al.
Veröffentlicht: (2024) -
Offline Policy Optimization with Posterior Sampling
von: Lin, Hongqiang, et al.
Veröffentlicht: (2026) -
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
von: Liang, Yile, et al.
Veröffentlicht: (2024)