On the Limitations of Markovian Rewards to Express Multi-Objective, Risk-Sensitive, and Modal Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Skalse, Joar, Abate, Alessandro |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Partial Identifiability and Misspecification in Inverse Reinforcement Learning
by: Skalse, Joar, et al.
Published: (2024)
by: Skalse, Joar, et al.
Published: (2024)
Partial Identifiability in Inverse Reinforcement Learning For Agents With Non-Exponential Discounting
by: Skalse, Joar, et al.
Published: (2024)
by: Skalse, Joar, et al.
Published: (2024)
Quantifying the Sensitivity of Inverse Reinforcement Learning to Misspecification
by: Skalse, Joar, et al.
Published: (2024)
by: Skalse, Joar, et al.
Published: (2024)
The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret
by: Fluri, Lukas, et al.
Published: (2024)
by: Fluri, Lukas, et al.
Published: (2024)
STARC: A General Framework For Quantifying Differences Between Reward Functions
by: Skalse, Joar, et al.
Published: (2023)
by: Skalse, Joar, et al.
Published: (2023)
DeepLTL: Learning to Efficiently Satisfy Complex LTL Specifications for Multi-Task RL
by: Jackermeier, Mathias, et al.
Published: (2024)
by: Jackermeier, Mathias, et al.
Published: (2024)
Probabilistic Performance Guarantees for Multi-Task Reinforcement Learning
by: Schnitzer, Yannik, et al.
Published: (2026)
by: Schnitzer, Yannik, et al.
Published: (2026)
Defining and Characterizing Reward Hacking
by: Skalse, Joar, et al.
Published: (2022)
by: Skalse, Joar, et al.
Published: (2022)
Semantically Labelled Automata for Multi-Task Reinforcement Learning with LTL Instructions
by: Abate, Alessandro, et al.
Published: (2026)
by: Abate, Alessandro, et al.
Published: (2026)
Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes
by: Trapasso, Alessandro, et al.
Published: (2025)
by: Trapasso, Alessandro, et al.
Published: (2025)
Automatic Reward Shaping from Multi-Objective Human Heuristics
by: Xie, Yuqing, et al.
Published: (2025)
by: Xie, Yuqing, et al.
Published: (2025)
On The Expressivity of Objective-Specification Formalisms in Reinforcement Learning
by: Subramani, Rohan, et al.
Published: (2023)
by: Subramani, Rohan, et al.
Published: (2023)
Learning When Not to Learn: Risk-Sensitive Abstention in Bandits with Unbounded Rewards
by: Liaw, Sarah, et al.
Published: (2025)
by: Liaw, Sarah, et al.
Published: (2025)
Zero-Shot Instruction Following in RL via Structured LTL Representations
by: Giuri, Mattia, et al.
Published: (2025)
by: Giuri, Mattia, et al.
Published: (2025)
Efficient Solution and Learning of Robust Factored MDPs
by: Schnitzer, Yannik, et al.
Published: (2025)
by: Schnitzer, Yannik, et al.
Published: (2025)
Multi-Task Reward Learning from Human Ratings
by: Wu, Mingkang, et al.
Published: (2025)
by: Wu, Mingkang, et al.
Published: (2025)
Neural Proofs for Sound Verification and Control of Complex Systems
by: Abate, Alessandro
Published: (2025)
by: Abate, Alessandro
Published: (2025)
Injecting Imbalance Sensitivity for Multi-Task Learning
by: Zhou, Zhipeng, et al.
Published: (2025)
by: Zhou, Zhipeng, et al.
Published: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
by: Pavlenko, Kirill, et al.
Published: (2026)
by: Pavlenko, Kirill, et al.
Published: (2026)
Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling
by: Li, Derek, et al.
Published: (2025)
by: Li, Derek, et al.
Published: (2025)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
by: Lin, Baijiong, et al.
Published: (2025)
by: Lin, Baijiong, et al.
Published: (2025)
Revisiting the Learning Objectives of Vision-Language Reward Models
by: Roy, Simon, et al.
Published: (2025)
by: Roy, Simon, et al.
Published: (2025)
Temporal-Difference Variational Continual Learning
by: Melo, Luckeciano C., et al.
Published: (2024)
by: Melo, Luckeciano C., et al.
Published: (2024)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
by: Melo, Luckeciano C., et al.
Published: (2025)
by: Melo, Luckeciano C., et al.
Published: (2025)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
by: Wu, Boyuan
Published: (2025)
by: Wu, Boyuan
Published: (2025)
Multi-Objective Optimization for Sparse Deep Multi-Task Learning
by: Hotegni, S. S., et al.
Published: (2023)
by: Hotegni, S. S., et al.
Published: (2023)
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols
by: Griffin, Charlie, et al.
Published: (2024)
by: Griffin, Charlie, et al.
Published: (2024)
Zero-Shot Instruction Following in RL via Structured LTL Representations
by: Jackermeier, Mathias, et al.
Published: (2026)
by: Jackermeier, Mathias, et al.
Published: (2026)
Reward-free Alignment for Conflicting Objectives
by: Chen, Peter, et al.
Published: (2026)
by: Chen, Peter, et al.
Published: (2026)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
by: Ma, Haozhe, et al.
Published: (2024)
by: Ma, Haozhe, et al.
Published: (2024)
Deep Sensitivity Analysis for Objective-Oriented Combinatorial Optimization
by: Gireesan, Ganga, et al.
Published: (2024)
by: Gireesan, Ganga, et al.
Published: (2024)
DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks
by: Mu, Tongzhou, et al.
Published: (2024)
by: Mu, Tongzhou, et al.
Published: (2024)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
by: Chaudhari, Shreyas, et al.
Published: (2025)
by: Chaudhari, Shreyas, et al.
Published: (2025)
Certifiably Robust Policies for Uncertain Parametric Environments
by: Schnitzer, Yannik, et al.
Published: (2024)
by: Schnitzer, Yannik, et al.
Published: (2024)
MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels
by: Luo, Tianyang, et al.
Published: (2026)
by: Luo, Tianyang, et al.
Published: (2026)
Training RL Agents for Multi-Objective Network Defense Tasks
by: Molina-Markham, Andres, et al.
Published: (2025)
by: Molina-Markham, Andres, et al.
Published: (2025)
Beyond Distribution Sharpening: The Importance of Task Rewards
by: Mittal, Sarthak, et al.
Published: (2026)
by: Mittal, Sarthak, et al.
Published: (2026)
Disentangling Shared and Task-Specific Representations from Multi-Modal Clinical Data
by: Lyu, He, et al.
Published: (2026)
by: Lyu, He, et al.
Published: (2026)
ParMod: A Parallel and Modular Framework for Learning Non-Markovian Tasks
by: Miao, Ruixuan, et al.
Published: (2024)
by: Miao, Ruixuan, et al.
Published: (2024)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
by: Aggarwal, Vaneet, et al.
Published: (2024)
by: Aggarwal, Vaneet, et al.
Published: (2024)
Similar Items
-
Partial Identifiability and Misspecification in Inverse Reinforcement Learning
by: Skalse, Joar, et al.
Published: (2024) -
Partial Identifiability in Inverse Reinforcement Learning For Agents With Non-Exponential Discounting
by: Skalse, Joar, et al.
Published: (2024) -
Quantifying the Sensitivity of Inverse Reinforcement Learning to Misspecification
by: Skalse, Joar, et al.
Published: (2024) -
The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret
by: Fluri, Lukas, et al.
Published: (2024) -
STARC: A General Framework For Quantifying Differences Between Reward Functions
by: Skalse, Joar, et al.
Published: (2023)