PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Jiaming, Hong, Donghai, Zhang, Borong, Chen, Boyuan, Dai, Juntao, Zheng, Boren, Qiu, Tianyi, Zhou, Jiayi, Wang, Kaile, Li, Boxuan, Han, Sirui, Guo, Yike, Yang, Yaodong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
Language Models Resist Alignment: Evidence From Data Compression
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
Reward Generalization in RLHF: A Topological Perspective
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
SafeMT: Multi-turn Safety for Multimodal Language Models
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
SafeLawBench: Towards Safe Alignment of Large Language Models
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
SafeDreamer: Safe Reinforcement Learning with World Models
di: Huang, Weidong, et al.
Pubblicazione: (2023)
di: Huang, Weidong, et al.
Pubblicazione: (2023)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
di: Dai, Josef, et al.
Pubblicazione: (2024)
di: Dai, Josef, et al.
Pubblicazione: (2024)
AI Alignment: A Comprehensive Survey
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
di: Wang, Zhaoxin, et al.
Pubblicazione: (2026)
di: Wang, Zhaoxin, et al.
Pubblicazione: (2026)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
di: Dai, Juntao, et al.
Pubblicazione: (2025)
di: Dai, Juntao, et al.
Pubblicazione: (2025)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
ProgressGym: Alignment with a Millennium of Moral Progress
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing
di: Zhang, Ruiyang, et al.
Pubblicazione: (2025)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2025)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
di: Wang, Lichao, et al.
Pubblicazione: (2026)
di: Wang, Lichao, et al.
Pubblicazione: (2026)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
di: Dai, Juntao, et al.
Pubblicazione: (2024)
di: Dai, Juntao, et al.
Pubblicazione: (2024)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
di: Zhang, Yuhao, et al.
Pubblicazione: (2026)
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
di: Srewa, Mahmoud, et al.
Pubblicazione: (2026)
di: Srewa, Mahmoud, et al.
Pubblicazione: (2026)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Benchmarking Multi-National Value Alignment for Large Language Models
di: Shi, Weijie, et al.
Pubblicazione: (2025)
di: Shi, Weijie, et al.
Pubblicazione: (2025)
A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs
di: Srewa, Mahmoud, et al.
Pubblicazione: (2025)
di: Srewa, Mahmoud, et al.
Pubblicazione: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
Democratic Preference Alignment via Sortition-Weighted RLHF
di: Sana, Suvadip, et al.
Pubblicazione: (2026)
di: Sana, Suvadip, et al.
Pubblicazione: (2026)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
di: Zhong, Yifan, et al.
Pubblicazione: (2024)
di: Zhong, Yifan, et al.
Pubblicazione: (2024)
Towards Federated RLHF with Aggregated Client Preference for LLMs
di: Wu, Feijie, et al.
Pubblicazione: (2024)
di: Wu, Feijie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025) -
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025) -
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025) -
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024) -
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
di: Chen, Boyuan, et al.
Pubblicazione: (2025)