Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Seungyub, Kim, Hyungjin, Lee, Jungwoo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPQR: Controlling Q-ensemble Independence with Spiked Random Model for Reinforcement Learning
por: Lee, Dohyeok, et al.
Publicado: (2024)
por: Lee, Dohyeok, et al.
Publicado: (2024)
On the Convergence of Continual Learning with Adaptive Methods
por: Han, Seungyub, et al.
Publicado: (2024)
por: Han, Seungyub, et al.
Publicado: (2024)
Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation
por: Cho, Taehyun, et al.
Publicado: (2024)
por: Cho, Taehyun, et al.
Publicado: (2024)
Spectral-Risk Safe Reinforcement Learning with Convergence Guarantees
por: Kim, Dohyeong, et al.
Publicado: (2024)
por: Kim, Dohyeong, et al.
Publicado: (2024)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)
por: Cho, Taehyun, et al.
Publicado: (2025)
Epigraph-Guided Flow Matching for Safe and Performant Offline Reinforcement Learning
por: Tayal, Manan, et al.
Publicado: (2026)
por: Tayal, Manan, et al.
Publicado: (2026)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
por: Zheng, Yinan, et al.
Publicado: (2024)
por: Zheng, Yinan, et al.
Publicado: (2024)
Safe Offline Reinforcement Learning with Real-Time Budget Constraints
por: Lin, Qian, et al.
Publicado: (2023)
por: Lin, Qian, et al.
Publicado: (2023)
Online Optimization for Offline Safe Reinforcement Learning
por: Chemingui, Yassine, et al.
Publicado: (2025)
por: Chemingui, Yassine, et al.
Publicado: (2025)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
por: Su, Huikang, et al.
Publicado: (2025)
por: Su, Huikang, et al.
Publicado: (2025)
Exclusively Penalized Q-learning for Offline Reinforcement Learning
por: Yeom, Junghyuk, et al.
Publicado: (2024)
por: Yeom, Junghyuk, et al.
Publicado: (2024)
Robust Probabilistic Shielding for Safe Offline Reinforcement Learning
por: Galesloot, Maris F. L., et al.
Publicado: (2026)
por: Galesloot, Maris F. L., et al.
Publicado: (2026)
Offline Safe Reinforcement Learning Using Trajectory Classification
por: Gong, Ze, et al.
Publicado: (2024)
por: Gong, Ze, et al.
Publicado: (2024)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
por: Chen, Rufeng, et al.
Publicado: (2026)
por: Chen, Rufeng, et al.
Publicado: (2026)
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
por: Chemingui, Yassine, et al.
Publicado: (2024)
por: Chemingui, Yassine, et al.
Publicado: (2024)
Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies
por: Tayal, Mumuksh, et al.
Publicado: (2026)
por: Tayal, Mumuksh, et al.
Publicado: (2026)
FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning
por: Kim, Woosung, et al.
Publicado: (2025)
por: Kim, Woosung, et al.
Publicado: (2025)
Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning
por: Kim, Minung, et al.
Publicado: (2026)
por: Kim, Minung, et al.
Publicado: (2026)
Flow Actor-Critic for Offline Reinforcement Learning
por: Chae, Jongseong, et al.
Publicado: (2026)
por: Chae, Jongseong, et al.
Publicado: (2026)
Test-Time Adaptation with Binary Feedback
por: Lee, Taeckyung, et al.
Publicado: (2025)
por: Lee, Taeckyung, et al.
Publicado: (2025)
Safe Deep Model-Based Reinforcement Learning with Lyapunov Functions
por: Zhang, Harry
Publicado: (2024)
por: Zhang, Harry
Publicado: (2024)
Reinforcement Learning by Guided Safe Exploration
por: Yang, Qisong, et al.
Publicado: (2023)
por: Yang, Qisong, et al.
Publicado: (2023)
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
por: Lin, Qian, et al.
Publicado: (2024)
por: Lin, Qian, et al.
Publicado: (2024)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
por: Richemond, Pierre Harvey, et al.
Publicado: (2024)
por: Richemond, Pierre Harvey, et al.
Publicado: (2024)
Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning
por: Guo, Zijian, et al.
Publicado: (2024)
por: Guo, Zijian, et al.
Publicado: (2024)
Offline Inverse Constrained Reinforcement Learning for Safe-Critical Decision Making in Healthcare
por: Fang, Nan, et al.
Publicado: (2024)
por: Fang, Nan, et al.
Publicado: (2024)
SelfBC: Self Behavior Cloning for Offline Reinforcement Learning
por: Liu, Shirong, et al.
Publicado: (2024)
por: Liu, Shirong, et al.
Publicado: (2024)
Compositional Conservatism: A Transductive Approach in Offline Reinforcement Learning
por: Song, Yeda, et al.
Publicado: (2024)
por: Song, Yeda, et al.
Publicado: (2024)
Federated Nested Learning: Collaborative Training of Self-Referential Memories for Test-Time Adaptation
por: Chen, Hong, et al.
Publicado: (2026)
por: Chen, Hong, et al.
Publicado: (2026)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
Safe Pruning LoRA: Robust Distance-Guided Pruning for Safety Alignment in Adaptation of LLMs
por: Ao, Shuang, et al.
Publicado: (2025)
por: Ao, Shuang, et al.
Publicado: (2025)
Offline Reinforcement Learning with Universal Horizon Models
por: Chung, Hojun, et al.
Publicado: (2026)
por: Chung, Hojun, et al.
Publicado: (2026)
Evaluation-Time Policy Switching for Offline Reinforcement Learning
por: Neggatu, Natinael Solomon, et al.
Publicado: (2025)
por: Neggatu, Natinael Solomon, et al.
Publicado: (2025)
Test-Time Meta-Adaptation with Self-Synthesis
por: Kaya, Zeyneb N., et al.
Publicado: (2026)
por: Kaya, Zeyneb N., et al.
Publicado: (2026)
Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning
por: Brahmanage, Janaka Chathuranga, et al.
Publicado: (2026)
por: Brahmanage, Janaka Chathuranga, et al.
Publicado: (2026)
Offline Trajectory Optimization for Offline Reinforcement Learning
por: Zhao, Ziqi, et al.
Publicado: (2024)
por: Zhao, Ziqi, et al.
Publicado: (2024)
Offline Reinforcement Learning with Penalized Action Noise Injection
por: Oh, JunHyeok, et al.
Publicado: (2025)
por: Oh, JunHyeok, et al.
Publicado: (2025)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
por: Song, Chihyeon, et al.
Publicado: (2025)
por: Song, Chihyeon, et al.
Publicado: (2025)
Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning
por: Park, Kwanyoung, et al.
Publicado: (2024)
por: Park, Kwanyoung, et al.
Publicado: (2024)
OffSim: Offline Simulator for Model-based Offline Inverse Reinforcement Learning
por: Ahn, Woo-Jin, et al.
Publicado: (2025)
por: Ahn, Woo-Jin, et al.
Publicado: (2025)
Ejemplares similares
-
SPQR: Controlling Q-ensemble Independence with Spiked Random Model for Reinforcement Learning
por: Lee, Dohyeok, et al.
Publicado: (2024) -
On the Convergence of Continual Learning with Adaptive Methods
por: Han, Seungyub, et al.
Publicado: (2024) -
Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation
por: Cho, Taehyun, et al.
Publicado: (2024) -
Spectral-Risk Safe Reinforcement Learning with Convergence Guarantees
por: Kim, Dohyeong, et al.
Publicado: (2024) -
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)