Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration
Fuente:
arXiv
Salvato in:
| Autori principali: | Roknilamouki, Amirhossein, Ghosh, Arnob, Ekici, Eylem, Shroff, Ness B. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025)
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025)
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
di: Nourzad, Fatemeh, et al.
Pubblicazione: (2025)
di: Nourzad, Fatemeh, et al.
Pubblicazione: (2025)
Online Learning for Optimizing AoI-Energy Tradeoff under Unknown Channel Statistics
di: Abd-Elmagid, Mohamed A., et al.
Pubblicazione: (2025)
di: Abd-Elmagid, Mohamed A., et al.
Pubblicazione: (2025)
Beyond Freshness and Semantics: A Coupon-Collector Framework for Effective Status Updates
di: Ahmed, Youssef, et al.
Pubblicazione: (2026)
di: Ahmed, Youssef, et al.
Pubblicazione: (2026)
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
di: Wei, Honghao, et al.
Pubblicazione: (2024)
di: Wei, Honghao, et al.
Pubblicazione: (2024)
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
di: Li, Yining, et al.
Pubblicazione: (2026)
di: Li, Yining, et al.
Pubblicazione: (2026)
How to Find the Exact Pareto Front for Multi-Objective MDPs?
di: Li, Yining, et al.
Pubblicazione: (2024)
di: Li, Yining, et al.
Pubblicazione: (2024)
Provably Efficient Multi-Objective Bandit Algorithms under Preference-Centric Customization
di: Cao, Linfeng, et al.
Pubblicazione: (2025)
di: Cao, Linfeng, et al.
Pubblicazione: (2025)
Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism
di: Yu, Kihyun, et al.
Pubblicazione: (2024)
di: Yu, Kihyun, et al.
Pubblicazione: (2024)
From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
From Robotics to Sepsis Treatment: Offline RL via Geometric Pessimism
di: Wanjari, Sarthak
Pubblicazione: (2026)
di: Wanjari, Sarthak
Pubblicazione: (2026)
A Tale of Two Cities: Pessimism and Opportunism in Offline Dynamic Pricing
di: Bian, Zeyu, et al.
Pubblicazione: (2024)
di: Bian, Zeyu, et al.
Pubblicazione: (2024)
Beyond Pessimism: Offline Learning in KL-regularized Games
di: Zhang, Yuheng, et al.
Pubblicazione: (2026)
di: Zhang, Yuheng, et al.
Pubblicazione: (2026)
Monitoring State Transitions in Markovian Systems with Sampling Cost
di: Saurav, Kumar, et al.
Pubblicazione: (2025)
di: Saurav, Kumar, et al.
Pubblicazione: (2025)
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
di: Shi, Ming, et al.
Pubblicazione: (2023)
di: Shi, Ming, et al.
Pubblicazione: (2023)
Tail-Risk-Safe Monte Carlo Tree Search under PAC-Level Guarantees
di: Zhang, Zuyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zuyuan, et al.
Pubblicazione: (2025)
From Curiosity to Caution: Mitigating Reward Hacking for Best-of-N with Pessimism
di: Yu, Zhuohao, et al.
Pubblicazione: (2026)
di: Yu, Zhuohao, et al.
Pubblicazione: (2026)
Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning
di: Zhang, Dake, et al.
Pubblicazione: (2024)
di: Zhang, Dake, et al.
Pubblicazione: (2024)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
di: Shi, Ming, et al.
Pubblicazione: (2026)
di: Shi, Ming, et al.
Pubblicazione: (2026)
BeST -- A Novel Source Selection Metric for Transfer Learning
di: Soni, Ashutosh, et al.
Pubblicazione: (2025)
di: Soni, Ashutosh, et al.
Pubblicazione: (2025)
Sharp Convergence Rates for Masked Diffusion Models
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
di: Liang, Yuchen, et al.
Pubblicazione: (2026)
Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
An LP-based Sampling Policy for Multi-Armed Bandits with Side-Observations and Stochastic Availability
di: Soni, Ashutosh, et al.
Pubblicazione: (2026)
di: Soni, Ashutosh, et al.
Pubblicazione: (2026)
Unified PAC-Bayesian Study of Pessimism for Offline Policy Learning with Regularized Importance Sampling
di: Aouali, Imad, et al.
Pubblicazione: (2024)
di: Aouali, Imad, et al.
Pubblicazione: (2024)
Pessimism-Free Offline Learning in General-Sum Games via KL Regularization
di: Chen, Claire, et al.
Pubblicazione: (2026)
di: Chen, Claire, et al.
Pubblicazione: (2026)
LexiSafe: Offline Safe Reinforcement Learning with Lexicographic Safety-Reward Hierarchy
di: Yang, Hsin-Jung, et al.
Pubblicazione: (2026)
di: Yang, Hsin-Jung, et al.
Pubblicazione: (2026)
Discrete Diffusion Models: Novel Analysis and New Sampler Guarantees
di: Liang, Yuchen, et al.
Pubblicazione: (2025)
di: Liang, Yuchen, et al.
Pubblicazione: (2025)
Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis Approach
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
di: Liang, Yuchen, et al.
Pubblicazione: (2024)
Mixture-of-Transformers Learn Faster: A Theoretical Study on Classification Problems
di: Li, Hongbo, et al.
Pubblicazione: (2025)
di: Li, Hongbo, et al.
Pubblicazione: (2025)
OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning
di: Yao, Yihang, et al.
Pubblicazione: (2024)
di: Yao, Yihang, et al.
Pubblicazione: (2024)
Provably Efficient Sample Complexity for Robust CMDP
di: Ganguly, Sourav, et al.
Pubblicazione: (2025)
di: Ganguly, Sourav, et al.
Pubblicazione: (2025)
Prediction-Assisted Online Distributed Deep Learning Workload Scheduling in GPU Clusters
di: Luo, Ziyue, et al.
Pubblicazione: (2025)
di: Luo, Ziyue, et al.
Pubblicazione: (2025)
Automatic Reward Shaping from Confounded Offline Data
di: Li, Mingxuan, et al.
Pubblicazione: (2025)
di: Li, Mingxuan, et al.
Pubblicazione: (2025)
Can We Theoretically Quantify the Impacts of Local Updates on the Generalization Performance of Federated Learning?
di: Ju, Peizhong, et al.
Pubblicazione: (2024)
di: Ju, Peizhong, et al.
Pubblicazione: (2024)
The Virtues of Pessimism in Inverse Reinforcement Learning
di: Wu, David, et al.
Pubblicazione: (2024)
di: Wu, David, et al.
Pubblicazione: (2024)
Constraint-Rectified Training for Efficient Chain-of-Thought
di: Wu, Qinhang, et al.
Pubblicazione: (2026)
di: Wu, Qinhang, et al.
Pubblicazione: (2026)
Theory on Mixture-of-Experts in Continual Learning
di: Li, Hongbo, et al.
Pubblicazione: (2024)
di: Li, Hongbo, et al.
Pubblicazione: (2024)
Certifiable Safe RLHF: Fixed-Penalty Constraint Optimization for Safer Language Models
di: Pandit, Kartik, et al.
Pubblicazione: (2025)
di: Pandit, Kartik, et al.
Pubblicazione: (2025)
Sparse-Reg: Improving Sample Complexity in Offline Reinforcement Learning using Sparsity
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
GPT-4o as the Gold Standard: A Scalable and General Purpose Approach to Filter Language Model Pretraining Data
di: Zhang, Jifan, et al.
Pubblicazione: (2024)
di: Zhang, Jifan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025) -
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
di: Nourzad, Fatemeh, et al.
Pubblicazione: (2025) -
Online Learning for Optimizing AoI-Energy Tradeoff under Unknown Channel Statistics
di: Abd-Elmagid, Mohamed A., et al.
Pubblicazione: (2025) -
Beyond Freshness and Semantics: A Coupon-Collector Framework for Effective Status Updates
di: Ahmed, Youssef, et al.
Pubblicazione: (2026) -
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
di: Wei, Honghao, et al.
Pubblicazione: (2024)