A Provable Approach for End-to-End Safe Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Wachi, Akifumi, Miyaguchi, Kohei, Tanabe, Takumi, Sato, Rei, Akimoto, Youhei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Sample-Efficient Hypergradient Estimation for Decentralized Bi-Level Reinforcement Learning
by: Kudo, Mikoto, et al.
Published: (2026)
by: Kudo, Mikoto, et al.
Published: (2026)
Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing
by: Tran, Thien Q., et al.
Published: (2025)
by: Tran, Thien Q., et al.
Published: (2025)
Stepwise Alignment for Constrained Language Model Policy Optimization
by: Wachi, Akifumi, et al.
Published: (2024)
by: Wachi, Akifumi, et al.
Published: (2024)
Long-term Safe Reinforcement Learning with Binary Feedback
by: Wachi, Akifumi, et al.
Published: (2024)
by: Wachi, Akifumi, et al.
Published: (2024)
Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment
by: Kusaka, Shigeki, et al.
Published: (2025)
by: Kusaka, Shigeki, et al.
Published: (2025)
Target Return Optimizer for Multi-Game Decision Transformer
by: Tatematsu, Kensuke, et al.
Published: (2025)
by: Tatematsu, Kensuke, et al.
Published: (2025)
A Survey of Constraint Formulations in Safe Reinforcement Learning
by: Wachi, Akifumi, et al.
Published: (2024)
by: Wachi, Akifumi, et al.
Published: (2024)
Implicit Safe Set Algorithm for Provably Safe Reinforcement Learning
by: Zhao, Weiye, et al.
Published: (2024)
by: Zhao, Weiye, et al.
Published: (2024)
Leveraging Analytic Gradients in Provably Safe Reinforcement Learning
by: Walter, Tim, et al.
Published: (2025)
by: Walter, Tim, et al.
Published: (2025)
Training and Simulation of Quadrupedal Robot in Adaptive Stair Climbing for Indoor Firefighting: An End-to-End Reinforcement Learning Approach
by: Huang, Baixiao, et al.
Published: (2026)
by: Huang, Baixiao, et al.
Published: (2026)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
by: Wachi, Akifumi, et al.
Published: (2026)
by: Wachi, Akifumi, et al.
Published: (2026)
Learning to be Smooth: An End-to-End Differentiable Particle Smoother
by: Younis, Ali, et al.
Published: (2025)
by: Younis, Ali, et al.
Published: (2025)
End-to-End Learning of Geometrical Shaping Maximizing Generalized Mutual Information
by: Gümüs, Kadir, et al.
Published: (2019)
by: Gümüs, Kadir, et al.
Published: (2019)
Inference-Aware Meta-Alignment of LLMs via Non-Linear GRPO
by: Takakura, Shokichi, et al.
Published: (2026)
by: Takakura, Shokichi, et al.
Published: (2026)
Spiking Neural Networks for Continuous Control via End-to-End Model-Based Learning
by: Huebotter, Justus, et al.
Published: (2025)
by: Huebotter, Justus, et al.
Published: (2025)
SoccerDiffusion: Toward Learning End-to-End Humanoid Robot Soccer from Gameplay Recordings
by: Vahl, Florian, et al.
Published: (2025)
by: Vahl, Florian, et al.
Published: (2025)
ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning
by: Chen, Wendi, et al.
Published: (2025)
by: Chen, Wendi, et al.
Published: (2025)
Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving
by: Zheng, Yinan, et al.
Published: (2026)
by: Zheng, Yinan, et al.
Published: (2026)
How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis
by: Higuchi, Rei, et al.
Published: (2026)
by: Higuchi, Rei, et al.
Published: (2026)
Information-Theoretic Policy Pre-Training with Empowerment
by: Schneider, Moritz, et al.
Published: (2025)
by: Schneider, Moritz, et al.
Published: (2025)
GUARD: A Safe Reinforcement Learning Benchmark
by: Zhao, Weiye, et al.
Published: (2023)
by: Zhao, Weiye, et al.
Published: (2023)
ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation
by: Lu, Dekun, et al.
Published: (2025)
by: Lu, Dekun, et al.
Published: (2025)
ExACT: An End-to-End Autonomous Excavator System Using Action Chunking With Transformers
by: Chen, Liangliang, et al.
Published: (2024)
by: Chen, Liangliang, et al.
Published: (2024)
Sampling-Based Safe Reinforcement Learning
by: Vignola, Luca, et al.
Published: (2026)
by: Vignola, Luca, et al.
Published: (2026)
AnyBipe: An End-to-End Framework for Training and Deploying Bipedal Robots Guided by Large Language Models
by: Yao, Yifei, et al.
Published: (2024)
by: Yao, Yifei, et al.
Published: (2024)
Learning What Matters: Adaptive Information-Theoretic Objectives for Robot Exploration
by: Yu, Youwei, et al.
Published: (2026)
by: Yu, Youwei, et al.
Published: (2026)
Provable Privacy Advantages of Decentralized Federated Learning via Distributed Optimization
by: Yu, Wenrui, et al.
Published: (2024)
by: Yu, Wenrui, et al.
Published: (2024)
Revisiting Safe Exploration in Safe Reinforcement learning
by: Eckel, David, et al.
Published: (2024)
by: Eckel, David, et al.
Published: (2024)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
by: Su, Huikang, et al.
Published: (2025)
by: Su, Huikang, et al.
Published: (2025)
Greedy Sampling Is Provably Efficient for RLHF
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
Safe Reinforcement Learning in a Simulated Robotic Arm
by: Kovač, Luka, et al.
Published: (2023)
by: Kovač, Luka, et al.
Published: (2023)
Solving the Cold Start Problem on One's Own as an End User via Preference Transfer
by: Sato, Ryoma
Published: (2025)
by: Sato, Ryoma
Published: (2025)
End-to-End Graph-Sequential Representation Learning for Accurate Recommendations
by: Baikalov, Vladimir, et al.
Published: (2024)
by: Baikalov, Vladimir, et al.
Published: (2024)
V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models
by: You, Junwei, et al.
Published: (2024)
by: You, Junwei, et al.
Published: (2024)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
by: Zheng, Yinan, et al.
Published: (2024)
by: Zheng, Yinan, et al.
Published: (2024)
Safe Offline Reinforcement Learning with Real-Time Budget Constraints
by: Lin, Qian, et al.
Published: (2023)
by: Lin, Qian, et al.
Published: (2023)
Physics-model-guided Worst-case Sampling for Safe Reinforcement Learning
by: Cao, Hongpeng, et al.
Published: (2024)
by: Cao, Hongpeng, et al.
Published: (2024)
Informational Embodiment: Computational role of information structure in codes and robots
by: Pitti, Alexandre, et al.
Published: (2024)
by: Pitti, Alexandre, et al.
Published: (2024)
Confidence-Based Decoding is Provably Efficient for Diffusion Language Models
by: Cai, Changxiao, et al.
Published: (2026)
by: Cai, Changxiao, et al.
Published: (2026)
Energy Saving for Cell-Free Massive MIMO Networks: A Multi-Agent Deep Reinforcement Learning Approach
by: Wang, Qichen, et al.
Published: (2026)
by: Wang, Qichen, et al.
Published: (2026)
Similar Items
-
Sample-Efficient Hypergradient Estimation for Decentralized Bi-Level Reinforcement Learning
by: Kudo, Mikoto, et al.
Published: (2026) -
Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing
by: Tran, Thien Q., et al.
Published: (2025) -
Stepwise Alignment for Constrained Language Model Policy Optimization
by: Wachi, Akifumi, et al.
Published: (2024) -
Long-term Safe Reinforcement Learning with Binary Feedback
by: Wachi, Akifumi, et al.
Published: (2024) -
Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment
by: Kusaka, Shigeki, et al.
Published: (2025)