Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Peng, Xiyue, Guo, Hengquan, Zhang, Jiawei, Zou, Dongqing, Shao, Ziyu, Wei, Honghao, Liu, Xin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning to Schedule Online Tasks with Bandit Feedback
by: Xu, Yongxin, et al.
Published: (2024)
by: Xu, Yongxin, et al.
Published: (2024)
Governance Challenges in Reinforcement Learning from Human Feedback: Evaluator Rationality and Reinforcement Stability
by: Alsagheer, Dana, et al.
Published: (2025)
by: Alsagheer, Dana, et al.
Published: (2025)
Ethics and Persuasion in Reinforcement Learning from Human Feedback: A Procedural Rhetorical Approach
by: Lodoen, Shannon, et al.
Published: (2025)
by: Lodoen, Shannon, et al.
Published: (2025)
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
by: Wei, Honghao, et al.
Published: (2024)
by: Wei, Honghao, et al.
Published: (2024)
BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft
by: Guo, Hengquan
Published: (2026)
by: Guo, Hengquan
Published: (2026)
Towards Fast Safe Online Reinforcement Learning via Policy Finetuning
by: Chen, Keru, et al.
Published: (2024)
by: Chen, Keru, et al.
Published: (2024)
Reinforcement Learning from Human Feedback: Whose Culture, Whose Values, Whose Perspectives?
by: Barman, Kristian González, et al.
Published: (2024)
by: Barman, Kristian González, et al.
Published: (2024)
AI Safety as Control of Irreversibility: A Systems Framework for Decision-Energy and Sovereignty Boundaries
by: Shu, Wesley, et al.
Published: (2026)
by: Shu, Wesley, et al.
Published: (2026)
H2-MARL: Multi-Agent Reinforcement Learning for Pareto Optimality in Hospital Capacity Strain and Human Mobility during Epidemic
by: Luo, Xueting, et al.
Published: (2025)
by: Luo, Xueting, et al.
Published: (2025)
Learning Fair Ranking Policies via Differentiable Optimization of Ordered Weighted Averages
by: Dinh, My H., et al.
Published: (2024)
by: Dinh, My H., et al.
Published: (2024)
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
by: Bai, Yuzhuo, et al.
Published: (2025)
by: Bai, Yuzhuo, et al.
Published: (2025)
Bridging Today and the Future of Humanity: AI Safety in 2024 and Beyond
by: Han, Shanshan
Published: (2024)
by: Han, Shanshan
Published: (2024)
Cognitive Structure Generation: From Educational Priors to Policy Optimization
by: Gu, Hengnian, et al.
Published: (2025)
by: Gu, Hengnian, et al.
Published: (2025)
Fast and Effective Redistricting Optimization via Composite-Move Tabu Search
by: Jin, Hai, et al.
Published: (2026)
by: Jin, Hai, et al.
Published: (2026)
Predicting Human Mobility during Extreme Events via LLM-Enhanced Cross-City Learning
by: Tang, Yinzhou, et al.
Published: (2025)
by: Tang, Yinzhou, et al.
Published: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
by: Xiao, Teng, et al.
Published: (2024)
by: Xiao, Teng, et al.
Published: (2024)
LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion
by: Zhou, Guanghao, et al.
Published: (2026)
by: Zhou, Guanghao, et al.
Published: (2026)
AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies
by: Zeng, Yi, et al.
Published: (2024)
by: Zeng, Yi, et al.
Published: (2024)
Comparative Analysis of Multi-Agent Reinforcement Learning Policies for Crop Planning Decision Support
by: Mahajan, Anubha, et al.
Published: (2024)
by: Mahajan, Anubha, et al.
Published: (2024)
Safety Optimized Reinforcement Learning via Multi-Objective Policy Optimization
by: Honari, Homayoun, et al.
Published: (2024)
by: Honari, Homayoun, et al.
Published: (2024)
The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1
by: Zhou, Kaiwen, et al.
Published: (2025)
by: Zhou, Kaiwen, et al.
Published: (2025)
Optimizing HIV Patient Engagement with Reinforcement Learning in Resource-Limited Settings
by: Periáñez, África, et al.
Published: (2024)
by: Periáñez, África, et al.
Published: (2024)
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
by: Chemingui, Yassine, et al.
Published: (2024)
by: Chemingui, Yassine, et al.
Published: (2024)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
by: Shen, Wei, et al.
Published: (2024)
by: Shen, Wei, et al.
Published: (2024)
Preserving Decision Sovereignty in Military AI: A Trade-Secret-Safe Architectural Framework for Model Replaceability, Human Authority, and State Control
by: Wei, Peng, et al.
Published: (2026)
by: Wei, Peng, et al.
Published: (2026)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
Copyleft for Alleviating AIGC Copyright Dilemma: What-if Analysis, Public Perception and Implications
by: Guo, Xinwei, et al.
Published: (2024)
by: Guo, Xinwei, et al.
Published: (2024)
Intelli-Planner: Towards Customized Urban Planning via Large Language Model Empowered Reinforcement Learning
by: Yong, Xixian, et al.
Published: (2026)
by: Yong, Xixian, et al.
Published: (2026)
Human-AI Safety: A Descendant of Generative AI and Control Systems Safety
by: Bajcsy, Andrea, et al.
Published: (2024)
by: Bajcsy, Andrea, et al.
Published: (2024)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
by: Hou, Hongru, et al.
Published: (2026)
by: Hou, Hongru, et al.
Published: (2026)
A Comparative Study of Technical Writing Feedback Quality: Evaluating LLMs, SLMs, and Humans in Computer Science Topics
by: Liu, Suqing, et al.
Published: (2025)
by: Liu, Suqing, et al.
Published: (2025)
Empowering Epidemic Response: The Role of Reinforcement Learning in Infectious Disease Control
by: Liu, Mutong, et al.
Published: (2026)
by: Liu, Mutong, et al.
Published: (2026)
Differentiating Student Feedbacks for Knowledge Tracing
by: Cui, Jiajun, et al.
Published: (2022)
by: Cui, Jiajun, et al.
Published: (2022)
AI Safety is Stuck in Technical Terms -- A System Safety Response to the International AI Safety Report
by: Dobbe, Roel
Published: (2025)
by: Dobbe, Roel
Published: (2025)
Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback
by: Keswani, Vijay, et al.
Published: (2025)
by: Keswani, Vijay, et al.
Published: (2025)
Closed-loop Teaching via Demonstrations to Improve Policy Transparency
by: Lee, Michael S., et al.
Published: (2024)
by: Lee, Michael S., et al.
Published: (2024)
Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents
by: Zhang, Chenyu, et al.
Published: (2025)
by: Zhang, Chenyu, et al.
Published: (2025)
Safety Cases: A Scalable Approach to Frontier AI Safety
by: Hilton, Benjamin, et al.
Published: (2025)
by: Hilton, Benjamin, et al.
Published: (2025)
Safety Cases: How to Justify the Safety of Advanced AI Systems
by: Clymer, Joshua, et al.
Published: (2024)
by: Clymer, Joshua, et al.
Published: (2024)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
by: Chittepu, Yaswanth, et al.
Published: (2025)
by: Chittepu, Yaswanth, et al.
Published: (2025)
Similar Items
-
Learning to Schedule Online Tasks with Bandit Feedback
by: Xu, Yongxin, et al.
Published: (2024) -
Governance Challenges in Reinforcement Learning from Human Feedback: Evaluator Rationality and Reinforcement Stability
by: Alsagheer, Dana, et al.
Published: (2025) -
Ethics and Persuasion in Reinforcement Learning from Human Feedback: A Procedural Rhetorical Approach
by: Lodoen, Shannon, et al.
Published: (2025) -
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
by: Wei, Honghao, et al.
Published: (2024) -
BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft
by: Guo, Hengquan
Published: (2026)