Enregistré dans:
| Auteurs principaux: | Corrado, Nicholas E., Hanna, Josiah P. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.01049 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
par: Corrado, Nicholas E., et autres
Publié: (2023)
par: Corrado, Nicholas E., et autres
Publié: (2023)
Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling
par: Corrado, Nicholas E., et autres
Publié: (2026)
par: Corrado, Nicholas E., et autres
Publié: (2026)
Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates
par: Corrado, Nicholas E., et autres
Publié: (2023)
par: Corrado, Nicholas E., et autres
Publié: (2023)
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
par: Corrado, Nicholas E., et autres
Publié: (2023)
par: Corrado, Nicholas E., et autres
Publié: (2023)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
SaVeR: Optimal Data Collection Strategy for Safe Policy Evaluation in Tabular MDP
par: Mukherjee, Subhojyoti, et autres
Publié: (2024)
par: Mukherjee, Subhojyoti, et autres
Publié: (2024)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
par: Jain, Arushi, et autres
Publié: (2024)
par: Jain, Arushi, et autres
Publié: (2024)
SPEED: Experimental Design for Policy Evaluation in Linear Heteroscedastic Bandits
par: Mukherjee, Subhojyoti, et autres
Publié: (2023)
par: Mukherjee, Subhojyoti, et autres
Publié: (2023)
When Can Model-Free Reinforcement Learning be Enough for Thinking?
par: Hanna, Josiah P., et autres
Publié: (2025)
par: Hanna, Josiah P., et autres
Publié: (2025)
Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning
par: Mukherjee, Subhojyoti, et autres
Publié: (2024)
par: Mukherjee, Subhojyoti, et autres
Publié: (2024)
SMAT: Staged Multi-Agent Training for Co-Adaptive Exoskeleton Control
par: Yuan, Yifei, et autres
Publié: (2026)
par: Yuan, Yifei, et autres
Publié: (2026)
Policy and World Modeling Co-Training for Language Agents
par: Lu, Ning, et autres
Publié: (2026)
par: Lu, Ning, et autres
Publié: (2026)
Stable Offline Value Function Learning with Bisimulation-based Representations
par: Pavse, Brahma S., et autres
Publié: (2024)
par: Pavse, Brahma S., et autres
Publié: (2024)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
par: Fakoor, Rasool, et autres
Publié: (2026)
par: Fakoor, Rasool, et autres
Publié: (2026)
Agent-Agnostic Centralized Training for Decentralized Multi-Agent Cooperative Driving
par: Yan, Shengchao, et autres
Publié: (2024)
par: Yan, Shengchao, et autres
Publié: (2024)
Learning to Stabilize Online Reinforcement Learning in Unbounded State Spaces
par: Pavse, Brahma S., et autres
Publié: (2023)
par: Pavse, Brahma S., et autres
Publié: (2023)
Adaptive Sample Sharing for Multi Agent Linear Bandits
par: Cherkaoui, Hamza, et autres
Publié: (2023)
par: Cherkaoui, Hamza, et autres
Publié: (2023)
AutoMixAlign: Adaptive Data Mixing for Multi-Task Preference Optimization in LLMs
par: Corrado, Nicholas E., et autres
Publié: (2025)
par: Corrado, Nicholas E., et autres
Publié: (2025)
An Empirical Study on the Power of Future Prediction in Partially Observable Environments
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
Adaptive Federated LoRA in Heterogeneous Wireless Networks with Independent Sampling
par: Hou, Yanzhao, et autres
Publié: (2025)
par: Hou, Yanzhao, et autres
Publié: (2025)
Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL
par: Patel, Shrenik, et autres
Publié: (2026)
par: Patel, Shrenik, et autres
Publié: (2026)
MAT-Agent: Adaptive Multi-Agent Training Optimization
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Centralized Permutation Equivariant Policy for Cooperative Multi-Agent Reinforcement Learning
par: Xu, Zhuofan, et autres
Publié: (2025)
par: Xu, Zhuofan, et autres
Publié: (2025)
Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems
par: Karnam, Meghana, et autres
Publié: (2026)
par: Karnam, Meghana, et autres
Publié: (2026)
Reinforcement Learning via Auxiliary Task Distillation
par: Harish, Abhinav Narayan, et autres
Publié: (2024)
par: Harish, Abhinav Narayan, et autres
Publié: (2024)
Adaptive Federated Learning in Heterogeneous Wireless Networks with Independent Sampling
par: Geng, Jiaxiang, et autres
Publié: (2024)
par: Geng, Jiaxiang, et autres
Publié: (2024)
An Introduction to Centralized Training for Decentralized Execution in Cooperative Multi-Agent Reinforcement Learning
par: Amato, Christopher
Publié: (2024)
par: Amato, Christopher
Publié: (2024)
Action-Graph Policies: Learning Action Co-dependencies in Multi-Agent Reinforcement Learning
par: Gupta, Nikunj, et autres
Publié: (2026)
par: Gupta, Nikunj, et autres
Publié: (2026)
Adaptive Gradient Normalization and Independent Sampling for (Stochastic) Generalized-Smooth Optimization
par: Yang, Yufeng, et autres
Publié: (2024)
par: Yang, Yufeng, et autres
Publié: (2024)
Sparsely Multimodal Data Fusion
par: Bjorgaard, Josiah
Publié: (2024)
par: Bjorgaard, Josiah
Publié: (2024)
Co-Optimizing Reconfigurable Environments and Policies for Decentralized Multi-Agent Navigation
par: Gao, Zhan, et autres
Publié: (2024)
par: Gao, Zhan, et autres
Publié: (2024)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
par: Liu, Zongkai, et autres
Publié: (2024)
par: Liu, Zongkai, et autres
Publié: (2024)
Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning
par: Jiang, Zhida, et autres
Publié: (2026)
par: Jiang, Zhida, et autres
Publié: (2026)
CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs
par: Tong, Stela, et autres
Publié: (2026)
par: Tong, Stela, et autres
Publié: (2026)
Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models
par: Zhang, Yang, et autres
Publié: (2024)
par: Zhang, Yang, et autres
Publié: (2024)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
par: Kim, Junseok, et autres
Publié: (2026)
par: Kim, Junseok, et autres
Publié: (2026)
Fully Independent Communication in Multi-Agent Reinforcement Learning
par: Pina, Rafael, et autres
Publié: (2024)
par: Pina, Rafael, et autres
Publié: (2024)
Emergent Coordination and Phase Structure in Independent Multi-Agent Reinforcement Learning
par: Yamaguchi, Azusa
Publié: (2025)
par: Yamaguchi, Azusa
Publié: (2025)
Balanced Training of Energy-Based Models with Adaptive Flow Sampling
par: Grenioux, Louis, et autres
Publié: (2023)
par: Grenioux, Louis, et autres
Publié: (2023)
Approximate Global Convergence of Independent Learning in Multi-Agent Systems
par: Jin, Ruiyang, et autres
Publié: (2024)
par: Jin, Ruiyang, et autres
Publié: (2024)
Documents similaires
-
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
par: Corrado, Nicholas E., et autres
Publié: (2023) -
Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling
par: Corrado, Nicholas E., et autres
Publié: (2026) -
Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates
par: Corrado, Nicholas E., et autres
Publié: (2023) -
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
par: Corrado, Nicholas E., et autres
Publié: (2023) -
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)