MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
Fuente:
arXiv
Saved in:
| Main Author: | Wu, Boyuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
by: Cho, Minjae, et al.
Published: (2026)
by: Cho, Minjae, et al.
Published: (2026)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
by: Ahmad, Ahmad, et al.
Published: (2024)
by: Ahmad, Ahmad, et al.
Published: (2024)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
by: Ma, Haozhe, et al.
Published: (2024)
by: Ma, Haozhe, et al.
Published: (2024)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
by: Deng, Boyuan, et al.
Published: (2025)
by: Deng, Boyuan, et al.
Published: (2025)
Multi-Task Reward Learning from Human Ratings
by: Wu, Mingkang, et al.
Published: (2025)
by: Wu, Mingkang, et al.
Published: (2025)
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
by: Zhan, Simon Sinong, et al.
Published: (2024)
by: Zhan, Simon Sinong, et al.
Published: (2024)
From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge
by: Wu, Xiefeng
Published: (2024)
by: Wu, Xiefeng
Published: (2024)
Bootstrapped Reward Shaping
by: Adamczyk, Jacob, et al.
Published: (2025)
by: Adamczyk, Jacob, et al.
Published: (2025)
Automatic Reward Shaping from Multi-Objective Human Heuristics
by: Xie, Yuqing, et al.
Published: (2025)
by: Xie, Yuqing, et al.
Published: (2025)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
by: Holmes, Ian, et al.
Published: (2025)
by: Holmes, Ian, et al.
Published: (2025)
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
by: Li, Derek, et al.
Published: (2025)
by: Li, Derek, et al.
Published: (2025)
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
by: Cao, Yuan, et al.
Published: (2026)
by: Cao, Yuan, et al.
Published: (2026)
Variational Task Vector Composition
by: Zhang, Boyuan, et al.
Published: (2025)
by: Zhang, Boyuan, et al.
Published: (2025)
Continual Optimization with Symmetry Teleportation for Multi-Task Learning
by: Zhou, Zhipeng, et al.
Published: (2025)
by: Zhou, Zhipeng, et al.
Published: (2025)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
by: Lidayan, Aly, et al.
Published: (2024)
by: Lidayan, Aly, et al.
Published: (2024)
Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training
by: Salimi, Moein, et al.
Published: (2026)
by: Salimi, Moein, et al.
Published: (2026)
On the Limitations of Markovian Rewards to Express Multi-Objective, Risk-Sensitive, and Modal Tasks
by: Skalse, Joar, et al.
Published: (2024)
by: Skalse, Joar, et al.
Published: (2024)
DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
by: Mu, Tongzhou, et al.
Published: (2024)
by: Mu, Tongzhou, et al.
Published: (2024)
Combining Automated Optimisation of Hyperparameters and Reward Shape
by: Dierkes, Julian, et al.
Published: (2024)
by: Dierkes, Julian, et al.
Published: (2024)
Explaining an Agent's Future Beliefs through Temporally Decomposing Future Reward Estimators
by: Towers, Mark, et al.
Published: (2024)
by: Towers, Mark, et al.
Published: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
by: Fu, Jiayi, et al.
Published: (2025)
by: Fu, Jiayi, et al.
Published: (2025)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards
by: Han, Zhixin, et al.
Published: (2026)
by: Han, Zhixin, et al.
Published: (2026)
Automatic Reward Shaping from Confounded Offline Data
by: Li, Mingxuan, et al.
Published: (2025)
by: Li, Mingxuan, et al.
Published: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
by: Qu, Yun, et al.
Published: (2024)
by: Qu, Yun, et al.
Published: (2024)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
by: Wang, Bowen, et al.
Published: (2026)
by: Wang, Bowen, et al.
Published: (2026)
Beyond Distribution Sharpening: The Importance of Task Rewards
by: Mittal, Sarthak, et al.
Published: (2026)
by: Mittal, Sarthak, et al.
Published: (2026)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
by: Kapoor, Aditya, et al.
Published: (2024)
by: Kapoor, Aditya, et al.
Published: (2024)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
by: Lin, Wenze, et al.
Published: (2026)
by: Lin, Wenze, et al.
Published: (2026)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
by: Okudo, Takato, et al.
Published: (2021)
by: Okudo, Takato, et al.
Published: (2021)
Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
by: Ma, Haozhe, et al.
Published: (2024)
by: Ma, Haozhe, et al.
Published: (2024)
2048: Reinforcement Learning in a Delayed Reward Environment
by: Saligram, Prady, et al.
Published: (2025)
by: Saligram, Prady, et al.
Published: (2025)
Fairness Aware Reward Optimization
by: Choi, Ching Lam, et al.
Published: (2026)
by: Choi, Ching Lam, et al.
Published: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
by: Xie, Tianbao, et al.
Published: (2023)
by: Xie, Tianbao, et al.
Published: (2023)
When Is Diversity Rewarded in Cooperative Multi-Agent Learning?
by: Amir, Michael, et al.
Published: (2025)
by: Amir, Michael, et al.
Published: (2025)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
by: Li, Wenyun, et al.
Published: (2025)
by: Li, Wenyun, et al.
Published: (2025)
On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning
by: Canonaco, Giuseppe, et al.
Published: (2024)
by: Canonaco, Giuseppe, et al.
Published: (2024)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
by: Wang, Haichuan, et al.
Published: (2026)
by: Wang, Haichuan, et al.
Published: (2026)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
by: Fan, Zhengyuan, et al.
Published: (2026)
by: Fan, Zhengyuan, et al.
Published: (2026)
Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
by: Roth, Amit, et al.
Published: (2026)
by: Roth, Amit, et al.
Published: (2026)
Similar Items
-
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
by: Cho, Minjae, et al.
Published: (2026) -
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
by: Ahmad, Ahmad, et al.
Published: (2024) -
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
by: Ma, Haozhe, et al.
Published: (2024) -
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
by: Deng, Boyuan, et al.
Published: (2025) -
Multi-Task Reward Learning from Human Ratings
by: Wu, Mingkang, et al.
Published: (2025)