Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings
Fuente:
arXiv
Salvato in:
| Autori principali: | Powell, Keenan, Yu, Peihong, Tokekar, Pratap |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
di: Barakat, Anas, et al.
Pubblicazione: (2024)
di: Barakat, Anas, et al.
Pubblicazione: (2024)
Attention-Based Reward Shaping for Sparse and Delayed Rewards
di: Holmes, Ian, et al.
Pubblicazione: (2025)
di: Holmes, Ian, et al.
Pubblicazione: (2025)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
Zero-Shot LLMs in Human-in-the-Loop RL: Replacing Human Feedback for Reward Shaping
di: Nazir, Mohammad Saif, et al.
Pubblicazione: (2025)
di: Nazir, Mohammad Saif, et al.
Pubblicazione: (2025)
Option Discovery Using LLM-guided Semantic Hierarchical Reinforcement Learning
di: Shek, Chak Lam, et al.
Pubblicazione: (2025)
di: Shek, Chak Lam, et al.
Pubblicazione: (2025)
Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning
di: Zhang, Heng, et al.
Pubblicazione: (2026)
di: Zhang, Heng, et al.
Pubblicazione: (2026)
VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
di: Chen, Shirui, et al.
Pubblicazione: (2026)
di: Chen, Shirui, et al.
Pubblicazione: (2026)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
di: Cho, Minjae, et al.
Pubblicazione: (2026)
di: Cho, Minjae, et al.
Pubblicazione: (2026)
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings
di: Frans, Kevin, et al.
Pubblicazione: (2024)
di: Frans, Kevin, et al.
Pubblicazione: (2024)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
di: Rocamonde, Juan, et al.
Pubblicazione: (2023)
di: Rocamonde, Juan, et al.
Pubblicazione: (2023)
Bootstrapped Reward Shaping
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
di: Li, Wenyun, et al.
Pubblicazione: (2025)
di: Li, Wenyun, et al.
Pubblicazione: (2025)
TACTIC: Task-Agnostic Contrastive pre-Training for Inter-Agent Communication
di: Yu, Peihong, et al.
Pubblicazione: (2025)
di: Yu, Peihong, et al.
Pubblicazione: (2025)
Active Asymmetric Multi-Agent Multimodal Learning under Uncertainty
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
Diversity-Rewarded CFG Distillation
di: Cideron, Geoffrey, et al.
Pubblicazione: (2024)
di: Cideron, Geoffrey, et al.
Pubblicazione: (2024)
Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs
di: Potteiger, Nicholas, et al.
Pubblicazione: (2026)
di: Potteiger, Nicholas, et al.
Pubblicazione: (2026)
Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning
di: Mahrooghi, Ilia, et al.
Pubblicazione: (2026)
di: Mahrooghi, Ilia, et al.
Pubblicazione: (2026)
Shaping Zero-Shot Coordination via State Blocking
di: Kang, Mingu, et al.
Pubblicazione: (2026)
di: Kang, Mingu, et al.
Pubblicazione: (2026)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
di: Wu, Boyuan
Pubblicazione: (2025)
di: Wu, Boyuan
Pubblicazione: (2025)
cMALC-D: Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Learning to Recover: Dynamic Reward Shaping with Wheel-Leg Coordination for Fallen Robots
di: Deng, Boyuan, et al.
Pubblicazione: (2025)
di: Deng, Boyuan, et al.
Pubblicazione: (2025)
Zero-Shot, Safe and Time-Efficient UAV Navigation via Potential-Based Reward Shaping, Control Lyapunov and Barrier Functions
di: Naeem, Ashik Abrar, et al.
Pubblicazione: (2026)
di: Naeem, Ashik Abrar, et al.
Pubblicazione: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Interpretable Reward Model via Sparse Autoencoder
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
Trajectory-Oriented Policy Optimization with Sparse Rewards
di: Wang, Guojian, et al.
Pubblicazione: (2024)
di: Wang, Guojian, et al.
Pubblicazione: (2024)
Noisy Zero-Shot Coordination: Breaking The Common Knowledge Assumption In Zero-Shot Coordination Games
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning
di: Zhang, Zheng, et al.
Pubblicazione: (2026)
di: Zhang, Zheng, et al.
Pubblicazione: (2026)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
di: Tao, Leitian, et al.
Pubblicazione: (2025)
di: Tao, Leitian, et al.
Pubblicazione: (2025)
Equivariant Networks for Zero-Shot Coordination
di: Muglich, Darius, et al.
Pubblicazione: (2022)
di: Muglich, Darius, et al.
Pubblicazione: (2022)
Automatic Reward Shaping from Multi-Objective Human Heuristics
di: Xie, Yuqing, et al.
Pubblicazione: (2025)
di: Xie, Yuqing, et al.
Pubblicazione: (2025)
A Constrained Multi-Agent Reinforcement Learning Approach to Autonomous Traffic Signal Control
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Adaptive Conformal Guidance for Learning under Uncertainty
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
PRISM: Performer RS-IMLE for Single-pass Multisensory Imitation Learning
di: Bhaskar, Amisha, et al.
Pubblicazione: (2026)
di: Bhaskar, Amisha, et al.
Pubblicazione: (2026)
Combining Automated Optimisation of Hyperparameters and Reward Shape
di: Dierkes, Julian, et al.
Pubblicazione: (2024)
di: Dierkes, Julian, et al.
Pubblicazione: (2024)
Revisiting Sparse Rewards for Goal-Reaching Reinforcement Learning
di: Vasan, Gautham, et al.
Pubblicazione: (2024)
di: Vasan, Gautham, et al.
Pubblicazione: (2024)
CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
di: Barakat, Anas, et al.
Pubblicazione: (2024) -
Attention-Based Reward Shaping for Sparse and Delayed Rewards
di: Holmes, Ian, et al.
Pubblicazione: (2025) -
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023) -
Zero-Shot LLMs in Human-in-the-Loop RL: Replacing Human Feedback for Reward Shaping
di: Nazir, Mohammad Saif, et al.
Pubblicazione: (2025) -
Option Discovery Using LLM-guided Semantic Hierarchical Reinforcement Learning
di: Shek, Chak Lam, et al.
Pubblicazione: (2025)