Salvato in:
| Autori principali: | Corrado, Nicholas E., Hanna, Josiah P. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2508.01049 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2026)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2026)
Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
SaVeR: Optimal Data Collection Strategy for Safe Policy Evaluation in Tabular MDP
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
SPEED: Experimental Design for Policy Evaluation in Linear Heteroscedastic Bandits
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023)
When Can Model-Free Reinforcement Learning be Enough for Thinking?
di: Hanna, Josiah P., et al.
Pubblicazione: (2025)
di: Hanna, Josiah P., et al.
Pubblicazione: (2025)
Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
SMAT: Staged Multi-Agent Training for Co-Adaptive Exoskeleton Control
di: Yuan, Yifei, et al.
Pubblicazione: (2026)
di: Yuan, Yifei, et al.
Pubblicazione: (2026)
Policy and World Modeling Co-Training for Language Agents
di: Lu, Ning, et al.
Pubblicazione: (2026)
di: Lu, Ning, et al.
Pubblicazione: (2026)
Stable Offline Value Function Learning with Bisimulation-based Representations
di: Pavse, Brahma S., et al.
Pubblicazione: (2024)
di: Pavse, Brahma S., et al.
Pubblicazione: (2024)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
Agent-Agnostic Centralized Training for Decentralized Multi-Agent Cooperative Driving
di: Yan, Shengchao, et al.
Pubblicazione: (2024)
di: Yan, Shengchao, et al.
Pubblicazione: (2024)
Learning to Stabilize Online Reinforcement Learning in Unbounded State Spaces
di: Pavse, Brahma S., et al.
Pubblicazione: (2023)
di: Pavse, Brahma S., et al.
Pubblicazione: (2023)
Adaptive Sample Sharing for Multi Agent Linear Bandits
di: Cherkaoui, Hamza, et al.
Pubblicazione: (2023)
di: Cherkaoui, Hamza, et al.
Pubblicazione: (2023)
AutoMixAlign: Adaptive Data Mixing for Multi-Task Preference Optimization in LLMs
di: Corrado, Nicholas E., et al.
Pubblicazione: (2025)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2025)
An Empirical Study on the Power of Future Prediction in Partially Observable Environments
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
Adaptive Federated LoRA in Heterogeneous Wireless Networks with Independent Sampling
di: Hou, Yanzhao, et al.
Pubblicazione: (2025)
di: Hou, Yanzhao, et al.
Pubblicazione: (2025)
Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL
di: Patel, Shrenik, et al.
Pubblicazione: (2026)
di: Patel, Shrenik, et al.
Pubblicazione: (2026)
MAT-Agent: Adaptive Multi-Agent Training Optimization
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
Centralized Permutation Equivariant Policy for Cooperative Multi-Agent Reinforcement Learning
di: Xu, Zhuofan, et al.
Pubblicazione: (2025)
di: Xu, Zhuofan, et al.
Pubblicazione: (2025)
Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems
di: Karnam, Meghana, et al.
Pubblicazione: (2026)
di: Karnam, Meghana, et al.
Pubblicazione: (2026)
Reinforcement Learning via Auxiliary Task Distillation
di: Harish, Abhinav Narayan, et al.
Pubblicazione: (2024)
di: Harish, Abhinav Narayan, et al.
Pubblicazione: (2024)
Adaptive Federated Learning in Heterogeneous Wireless Networks with Independent Sampling
di: Geng, Jiaxiang, et al.
Pubblicazione: (2024)
di: Geng, Jiaxiang, et al.
Pubblicazione: (2024)
An Introduction to Centralized Training for Decentralized Execution in Cooperative Multi-Agent Reinforcement Learning
di: Amato, Christopher
Pubblicazione: (2024)
di: Amato, Christopher
Pubblicazione: (2024)
Action-Graph Policies: Learning Action Co-dependencies in Multi-Agent Reinforcement Learning
di: Gupta, Nikunj, et al.
Pubblicazione: (2026)
di: Gupta, Nikunj, et al.
Pubblicazione: (2026)
Adaptive Gradient Normalization and Independent Sampling for (Stochastic) Generalized-Smooth Optimization
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Sparsely Multimodal Data Fusion
di: Bjorgaard, Josiah
Pubblicazione: (2024)
di: Bjorgaard, Josiah
Pubblicazione: (2024)
Co-Optimizing Reconfigurable Environments and Policies for Decentralized Multi-Agent Navigation
di: Gao, Zhan, et al.
Pubblicazione: (2024)
di: Gao, Zhan, et al.
Pubblicazione: (2024)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
Rollout-Training Co-Design for Efficient LLM-Based Multi-Agent Reinforcement Learning
di: Jiang, Zhida, et al.
Pubblicazione: (2026)
di: Jiang, Zhida, et al.
Pubblicazione: (2026)
CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs
di: Tong, Stela, et al.
Pubblicazione: (2026)
di: Tong, Stela, et al.
Pubblicazione: (2026)
Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models
di: Zhang, Yang, et al.
Pubblicazione: (2024)
di: Zhang, Yang, et al.
Pubblicazione: (2024)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
di: Kim, Junseok, et al.
Pubblicazione: (2026)
di: Kim, Junseok, et al.
Pubblicazione: (2026)
Fully Independent Communication in Multi-Agent Reinforcement Learning
di: Pina, Rafael, et al.
Pubblicazione: (2024)
di: Pina, Rafael, et al.
Pubblicazione: (2024)
Emergent Coordination and Phase Structure in Independent Multi-Agent Reinforcement Learning
di: Yamaguchi, Azusa
Pubblicazione: (2025)
di: Yamaguchi, Azusa
Pubblicazione: (2025)
Balanced Training of Energy-Based Models with Adaptive Flow Sampling
di: Grenioux, Louis, et al.
Pubblicazione: (2023)
di: Grenioux, Louis, et al.
Pubblicazione: (2023)
Approximate Global Convergence of Independent Learning in Multi-Agent Systems
di: Jin, Ruiyang, et al.
Pubblicazione: (2024)
di: Jin, Ruiyang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023) -
Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2026) -
Understanding when Dynamics-Invariant Data Augmentations Benefit Model-Free Reinforcement Learning Updates
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023) -
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023) -
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)