MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
Fuente:
arXiv
Guardado en:
| Autor principal: | Wu, Boyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
por: Cho, Minjae, et al.
Publicado: (2026)
por: Cho, Minjae, et al.
Publicado: (2026)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
por: Ahmad, Ahmad, et al.
Publicado: (2024)
por: Ahmad, Ahmad, et al.
Publicado: (2024)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
por: Ma, Haozhe, et al.
Publicado: (2024)
por: Ma, Haozhe, et al.
Publicado: (2024)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
por: Deng, Boyuan, et al.
Publicado: (2025)
por: Deng, Boyuan, et al.
Publicado: (2025)
Multi-Task Reward Learning from Human Ratings
por: Wu, Mingkang, et al.
Publicado: (2025)
por: Wu, Mingkang, et al.
Publicado: (2025)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
por: Zhan, Simon Sinong, et al.
Publicado: (2024)
From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
por: Wu, Xiefeng
Publicado: (2024)
por: Wu, Xiefeng
Publicado: (2024)
Bootstrapped Reward Shaping
por: Adamczyk, Jacob, et al.
Publicado: (2025)
por: Adamczyk, Jacob, et al.
Publicado: (2025)
Automatic Reward Shaping from Multi-Objective Human Heuristics
por: Xie, Yuqing, et al.
Publicado: (2025)
por: Xie, Yuqing, et al.
Publicado: (2025)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
por: Holmes, Ian, et al.
Publicado: (2025)
por: Holmes, Ian, et al.
Publicado: (2025)
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
por: Li, Derek, et al.
Publicado: (2025)
por: Li, Derek, et al.
Publicado: (2025)
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
por: Cao, Yuan, et al.
Publicado: (2026)
por: Cao, Yuan, et al.
Publicado: (2026)
Variational Task Vector Composition
por: Zhang, Boyuan, et al.
Publicado: (2025)
por: Zhang, Boyuan, et al.
Publicado: (2025)
Continual Optimization with Symmetry Teleportation for Multi-Task Learning
por: Zhou, Zhipeng, et al.
Publicado: (2025)
por: Zhou, Zhipeng, et al.
Publicado: (2025)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
por: Lidayan, Aly, et al.
Publicado: (2024)
por: Lidayan, Aly, et al.
Publicado: (2024)
Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training
por: Salimi, Moein, et al.
Publicado: (2026)
por: Salimi, Moein, et al.
Publicado: (2026)
On the Limitations of Markovian Rewards to Express Multi-Objective, Risk-Sensitive, and Modal Tasks
por: Skalse, Joar, et al.
Publicado: (2024)
por: Skalse, Joar, et al.
Publicado: (2024)
DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
por: Mu, Tongzhou, et al.
Publicado: (2024)
por: Mu, Tongzhou, et al.
Publicado: (2024)
Combining Automated Optimisation of Hyperparameters and Reward Shape
por: Dierkes, Julian, et al.
Publicado: (2024)
por: Dierkes, Julian, et al.
Publicado: (2024)
Explaining an Agent's Future Beliefs through Temporally Decomposing Future Reward Estimators
por: Towers, Mark, et al.
Publicado: (2024)
por: Towers, Mark, et al.
Publicado: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards
por: Han, Zhixin, et al.
Publicado: (2026)
por: Han, Zhixin, et al.
Publicado: (2026)
Automatic Reward Shaping from Confounded Offline Data
por: Li, Mingxuan, et al.
Publicado: (2025)
por: Li, Mingxuan, et al.
Publicado: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
por: Qu, Yun, et al.
Publicado: (2024)
por: Qu, Yun, et al.
Publicado: (2024)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
por: Wang, Bowen, et al.
Publicado: (2026)
por: Wang, Bowen, et al.
Publicado: (2026)
Beyond Distribution Sharpening: The Importance of Task Rewards
por: Mittal, Sarthak, et al.
Publicado: (2026)
por: Mittal, Sarthak, et al.
Publicado: (2026)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
por: Kapoor, Aditya, et al.
Publicado: (2024)
por: Kapoor, Aditya, et al.
Publicado: (2024)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
por: Lin, Wenze, et al.
Publicado: (2026)
por: Lin, Wenze, et al.
Publicado: (2026)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
por: Okudo, Takato, et al.
Publicado: (2021)
por: Okudo, Takato, et al.
Publicado: (2021)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
por: Ma, Haozhe, et al.
Publicado: (2024)
por: Ma, Haozhe, et al.
Publicado: (2024)
2048: Reinforcement Learning in a Delayed Reward Environment
por: Saligram, Prady, et al.
Publicado: (2025)
por: Saligram, Prady, et al.
Publicado: (2025)
Fairness Aware Reward Optimization
por: Choi, Ching Lam, et al.
Publicado: (2026)
por: Choi, Ching Lam, et al.
Publicado: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
When Is Diversity Rewarded in Cooperative Multi-Agent Learning?
por: Amir, Michael, et al.
Publicado: (2025)
por: Amir, Michael, et al.
Publicado: (2025)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
por: Li, Wenyun, et al.
Publicado: (2025)
por: Li, Wenyun, et al.
Publicado: (2025)
On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning
por: Canonaco, Giuseppe, et al.
Publicado: (2024)
por: Canonaco, Giuseppe, et al.
Publicado: (2024)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
por: Wang, Haichuan, et al.
Publicado: (2026)
por: Wang, Haichuan, et al.
Publicado: (2026)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
por: Fan, Zhengyuan, et al.
Publicado: (2026)
por: Fan, Zhengyuan, et al.
Publicado: (2026)
Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
por: Roth, Amit, et al.
Publicado: (2026)
por: Roth, Amit, et al.
Publicado: (2026)
Ejemplares similares
-
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
por: Cho, Minjae, et al.
Publicado: (2026) -
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
por: Ahmad, Ahmad, et al.
Publicado: (2024) -
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
por: Ma, Haozhe, et al.
Publicado: (2024) -
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
por: Deng, Boyuan, et al.
Publicado: (2025) -
Multi-Task Reward Learning from Human Ratings
por: Wu, Mingkang, et al.
Publicado: (2025)