Average Reward Reinforcement Learning for Omega-Regular and Mean-Payoff Objectives
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kazemi, Milad, Perez, Mateo, Somenzi, Fabio, Soudjani, Sadegh, Trivedi, Ashutosh, Velasquez, Alvaro |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A PAC Learning Algorithm for LTL and Omega-regular Objectives in MDPs
par: Perez, Mateo, et autres
Publié: (2023)
par: Perez, Mateo, et autres
Publié: (2023)
BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
par: Taheri, Ali, et autres
Publié: (2025)
par: Taheri, Ali, et autres
Publié: (2025)
Explaining Hitori Puzzles: Neurosymbolic Proof Staging for Sequential Decisions
par: Pacheco, Maria Leonor, et autres
Publié: (2025)
par: Pacheco, Maria Leonor, et autres
Publié: (2025)
Regret-Free Reinforcement Learning for LTL Specifications
par: Majumdar, Rupak, et autres
Publié: (2024)
par: Majumdar, Rupak, et autres
Publié: (2024)
LLMs as Probabilistic Minimally Adequate Teachers for DFA Learning
par: Chen, Lekai, et autres
Publié: (2024)
par: Chen, Lekai, et autres
Publié: (2024)
Reinforcement Learning with LTL and $ω$-Regular Objectives via Optimality-Preserving Translation to Average Rewards
par: Le, Xuan-Bach, et autres
Publié: (2024)
par: Le, Xuan-Bach, et autres
Publié: (2024)
A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
par: Shtossel, Erel, et autres
Publié: (2026)
par: Shtossel, Erel, et autres
Publié: (2026)
Revelations: A Decidable Class of POMDPs with Omega-Regular Objectives
par: Belly, Marius, et autres
Publié: (2024)
par: Belly, Marius, et autres
Publié: (2024)
Kernel-Based Learning of Safety Barriers
par: Schön, Oliver, et autres
Publié: (2026)
par: Schön, Oliver, et autres
Publié: (2026)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
par: Aggarwal, Vaneet, et autres
Publié: (2024)
par: Aggarwal, Vaneet, et autres
Publié: (2024)
Safety Certification is Classification
par: Schön, Oliver, et autres
Publié: (2026)
par: Schön, Oliver, et autres
Publié: (2026)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
par: Nadali, Alireza, et autres
Publié: (2026)
par: Nadali, Alireza, et autres
Publié: (2026)
Formal Control for Uncertain Systems via Contract-Based Probabilistic Surrogates (Extended Version)
par: Schön, Oliver, et autres
Publié: (2025)
par: Schön, Oliver, et autres
Publié: (2025)
Learning in Repeated Multi-Objective Stackelberg Games with Payoff Manipulation
par: Srisawad, Phurinut, et autres
Publié: (2025)
par: Srisawad, Phurinut, et autres
Publié: (2025)
Multiple Mean-Payoff Optimization under Local Stability Constraints
par: Klaška, David, et autres
Publié: (2024)
par: Klaška, David, et autres
Publié: (2024)
Reinforcement Learning with $ω$-Regular Objectives and Constraints
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Causal Temporal Reasoning for Markov Decision Processes
par: Kazemi, Milad, et autres
Publié: (2022)
par: Kazemi, Milad, et autres
Publié: (2022)
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
par: Kar, Avik, et autres
Publié: (2024)
par: Kar, Avik, et autres
Publié: (2024)
Monotonicity as an Architectural Bias for Robust Language Models
par: Cooper, Patrick, et autres
Publié: (2026)
par: Cooper, Patrick, et autres
Publié: (2026)
Robust Counterfactual Inference in Markov Decision Processes
par: Lally, Jessica, et autres
Publié: (2025)
par: Lally, Jessica, et autres
Publié: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Transfer of Safety Controllers Through Learning Deep Inverse Dynamics Model
par: Nadali, Alireza, et autres
Publié: (2024)
par: Nadali, Alireza, et autres
Publié: (2024)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
par: Vakili, Sattar, et autres
Publié: (2024)
par: Vakili, Sattar, et autres
Publié: (2024)
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
par: Schlaginhaufen, Andreas, et autres
Publié: (2024)
par: Schlaginhaufen, Andreas, et autres
Publié: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
Stage-Wise Reward Shaping for Acrobatic Robots: A Constrained Multi-Objective Reinforcement Learning Approach
par: Kim, Dohyeong, et autres
Publié: (2024)
par: Kim, Dohyeong, et autres
Publié: (2024)
Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
par: Song, Junjie, et autres
Publié: (2025)
par: Song, Junjie, et autres
Publié: (2025)
RLAF: Reinforcement Learning from Automaton Feedback
par: Alinejad, Mahyar, et autres
Publié: (2025)
par: Alinejad, Mahyar, et autres
Publié: (2025)
Integrating Explanations in Learning LTL Specifications from Demonstrations
par: Gupta, Ashutosh, et autres
Publié: (2024)
par: Gupta, Ashutosh, et autres
Publié: (2024)
Analyzing the Effectiveness of Large Language Models on Text-to-SQL Synthesis
par: Roberson, Richard, et autres
Publié: (2024)
par: Roberson, Richard, et autres
Publié: (2024)
Beyond Scalar Rewards: Distributional Reinforcement Learning with Preordered Objectives for Safe and Reliable Autonomous Driving
par: Abouelazm, Ahmed, et autres
Publié: (2026)
par: Abouelazm, Ahmed, et autres
Publié: (2026)
Burning RED: Unlocking Subtask-Driven Reinforcement Learning and Risk-Awareness in Average-Reward Markov Decision Processes
par: Rojas, Juan Sebastian, et autres
Publié: (2024)
par: Rojas, Juan Sebastian, et autres
Publié: (2024)
Revisiting the Learning Objectives of Vision-Language Reward Models
par: Roy, Simon, et autres
Publié: (2025)
par: Roy, Simon, et autres
Publié: (2025)
Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes
par: Trapasso, Alessandro, et autres
Publié: (2025)
par: Trapasso, Alessandro, et autres
Publié: (2025)
Polychromic Objectives for Reinforcement Learning
par: Hamid, Jubayer Ibn, et autres
Publié: (2025)
par: Hamid, Jubayer Ibn, et autres
Publié: (2025)
Average-Reward Soft Actor-Critic
par: Adamczyk, Jacob, et autres
Publié: (2025)
par: Adamczyk, Jacob, et autres
Publié: (2025)
Counterfactual Influence in Markov Decision Processes
par: Kazemi, Milad, et autres
Publié: (2024)
par: Kazemi, Milad, et autres
Publié: (2024)
Learning Pareto-Optimal Rewards from Noisy Preferences: A Framework for Multi-Objective Inverse Reinforcement Learning
par: Cherukuri, Kalyan, et autres
Publié: (2025)
par: Cherukuri, Kalyan, et autres
Publié: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
par: Mahmoud, Anas, et autres
Publié: (2026)
par: Mahmoud, Anas, et autres
Publié: (2026)
Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients
par: Thrampoulidis, Christos, et autres
Publié: (2025)
par: Thrampoulidis, Christos, et autres
Publié: (2025)
Documents similaires
-
A PAC Learning Algorithm for LTL and Omega-regular Objectives in MDPs
par: Perez, Mateo, et autres
Publié: (2023) -
BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
par: Taheri, Ali, et autres
Publié: (2025) -
Explaining Hitori Puzzles: Neurosymbolic Proof Staging for Sequential Decisions
par: Pacheco, Maria Leonor, et autres
Publié: (2025) -
Regret-Free Reinforcement Learning for LTL Specifications
par: Majumdar, Rupak, et autres
Publié: (2024) -
LLMs as Probabilistic Minimally Adequate Teachers for DFA Learning
par: Chen, Lekai, et autres
Publié: (2024)