Multi-Task Reward Learning from Human Ratings
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Mingkang, White, Devin, Rose, Evelyn, Lawhern, Vernon, Waytowich, Nicholas R, Cao, Yongcan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Performance Optimization of Ratings-Based Reinforcement Learning
por: Rose, Evelyn, et al.
Publicado: (2025)
por: Rose, Evelyn, et al.
Publicado: (2025)
Human-Inspired Multi-Level Reinforcement Learning
por: Wu, Mingkang, et al.
Publicado: (2025)
por: Wu, Mingkang, et al.
Publicado: (2025)
Rating-based Reinforcement Learning
por: White, Devin, et al.
Publicado: (2023)
por: White, Devin, et al.
Publicado: (2023)
R2BC: Multi-Agent Imitation Learning from Single-Agent Demonstrations
por: Mattson, Connor, et al.
Publicado: (2025)
por: Mattson, Connor, et al.
Publicado: (2025)
Crowd-PrefRL: Preference-Based Reward Learning from Crowds
por: Chhan, David, et al.
Publicado: (2024)
por: Chhan, David, et al.
Publicado: (2024)
Adaptive Event-triggered Reinforcement Learning Control for Complex Nonlinear Systems
por: Siddique, Umer, et al.
Publicado: (2024)
por: Siddique, Umer, et al.
Publicado: (2024)
From Explainability to Interpretability: Interpretable Policies in Reinforcement Learning Via Model Explanation
por: Li, Peilang, et al.
Publicado: (2025)
por: Li, Peilang, et al.
Publicado: (2025)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
por: Wu, Boyuan
Publicado: (2025)
por: Wu, Boyuan
Publicado: (2025)
Scalable Interactive Machine Learning for Future Command and Control
por: Madison, Anna, et al.
Publicado: (2024)
por: Madison, Anna, et al.
Publicado: (2024)
Atari-GPT: Benchmarking Multimodal Large Language Models as Low-Level Policies in Atari Games
por: Waytowich, Nicholas R., et al.
Publicado: (2024)
por: Waytowich, Nicholas R., et al.
Publicado: (2024)
DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
por: Mu, Tongzhou, et al.
Publicado: (2024)
por: Mu, Tongzhou, et al.
Publicado: (2024)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
por: Ma, Haozhe, et al.
Publicado: (2024)
por: Ma, Haozhe, et al.
Publicado: (2024)
Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers
por: Barron, Joshua, et al.
Publicado: (2025)
por: Barron, Joshua, et al.
Publicado: (2025)
ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling
por: Wallace, Conor, et al.
Publicado: (2025)
por: Wallace, Conor, et al.
Publicado: (2025)
Automatic Reward Shaping from Multi-Objective Human Heuristics
por: Xie, Yuqing, et al.
Publicado: (2025)
por: Xie, Yuqing, et al.
Publicado: (2025)
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
por: Li, Derek, et al.
Publicado: (2025)
por: Li, Derek, et al.
Publicado: (2025)
Residual Reward Models for Preference-based Reinforcement Learning
por: Cao, Chenyang, et al.
Publicado: (2025)
por: Cao, Chenyang, et al.
Publicado: (2025)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
por: Wu, Yuning, et al.
Publicado: (2026)
por: Wu, Yuning, et al.
Publicado: (2026)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise
por: Wu, Xuefei, et al.
Publicado: (2025)
por: Wu, Xuefei, et al.
Publicado: (2025)
On the Limitations of Markovian Rewards to Express Multi-Objective, Risk-Sensitive, and Modal Tasks
por: Skalse, Joar, et al.
Publicado: (2024)
por: Skalse, Joar, et al.
Publicado: (2024)
Adaptive Querying for Reward Learning from Human Feedback
por: Anand, Yashwanthi, et al.
Publicado: (2024)
por: Anand, Yashwanthi, et al.
Publicado: (2024)
Batch Active Learning of Reward Functions from Human Preferences
por: Bıyık, Erdem, et al.
Publicado: (2024)
por: Bıyık, Erdem, et al.
Publicado: (2024)
Beyond Distribution Sharpening: The Importance of Task Rewards
por: Mittal, Sarthak, et al.
Publicado: (2026)
por: Mittal, Sarthak, et al.
Publicado: (2026)
Can Differentiable Decision Trees Enable Interpretable Reward Learning from Human Feedback?
por: Kalra, Akansha, et al.
Publicado: (2023)
por: Kalra, Akansha, et al.
Publicado: (2023)
Continual Optimization with Symmetry Teleportation for Multi-Task Learning
por: Zhou, Zhipeng, et al.
Publicado: (2025)
por: Zhou, Zhipeng, et al.
Publicado: (2025)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
por: Deng, Yongxin, et al.
Publicado: (2024)
por: Deng, Yongxin, et al.
Publicado: (2024)
SemiReward: A General Reward Model for Semi-supervised Learning
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Efficient UAV Swarm-Based Multi-Task Federated Learning with Dynamic Task Knowledge Sharing
por: Yang, Yubo, et al.
Publicado: (2025)
por: Yang, Yubo, et al.
Publicado: (2025)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
por: Li, Xin-Ye, et al.
Publicado: (2026)
por: Li, Xin-Ye, et al.
Publicado: (2026)
Task Scheduling & Forgetting in Multi-Task Reinforcement Learning
por: Speckmann, Marc, et al.
Publicado: (2025)
por: Speckmann, Marc, et al.
Publicado: (2025)
Task Addition in Multi-Task Learning by Geometrical Alignment
por: Yim, Soorin, et al.
Publicado: (2024)
por: Yim, Soorin, et al.
Publicado: (2024)
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
por: Kim, Kihyun, et al.
Publicado: (2024)
por: Kim, Kihyun, et al.
Publicado: (2024)
R-LoRA: Randomized Multi-Head LoRA for Efficient Multi-Task Learning
por: Liu, Jinda, et al.
Publicado: (2025)
por: Liu, Jinda, et al.
Publicado: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
por: Ahmad, Ahmad, et al.
Publicado: (2024)
por: Ahmad, Ahmad, et al.
Publicado: (2024)
COA-GPT: Generative Pre-trained Transformers for Accelerated Course of Action Development in Military Operations
por: Goecks, Vinicius G., et al.
Publicado: (2024)
por: Goecks, Vinicius G., et al.
Publicado: (2024)
Real-Time Performance Analysis of Multi-Fidelity Residual Physics-Informed Neural Process-Based State Estimation for Robotic Systems
por: Hunter, Devin, et al.
Publicado: (2025)
por: Hunter, Devin, et al.
Publicado: (2025)
Capturing Individual Human Preferences with Reward Features
por: Barreto, André, et al.
Publicado: (2025)
por: Barreto, André, et al.
Publicado: (2025)
Reinforcement Learning with Conditional Expectation Reward
por: Xiao, Changyi, et al.
Publicado: (2026)
por: Xiao, Changyi, et al.
Publicado: (2026)
Ejemplares similares
-
Performance Optimization of Ratings-Based Reinforcement Learning
por: Rose, Evelyn, et al.
Publicado: (2025) -
Human-Inspired Multi-Level Reinforcement Learning
por: Wu, Mingkang, et al.
Publicado: (2025) -
Rating-based Reinforcement Learning
por: White, Devin, et al.
Publicado: (2023) -
R2BC: Multi-Agent Imitation Learning from Single-Agent Demonstrations
por: Mattson, Connor, et al.
Publicado: (2025) -
Crowd-PrefRL: Preference-Based Reward Learning from Crowds
por: Chhan, David, et al.
Publicado: (2024)