LLM Safety Alignment is Divergence Estimation in Disguise
Fuente:
arXiv
Salvato in:
| Autori principali: | Haldar, Rajdeep, Wang, Ziyi, Song, Qifan, Lin, Guang, Xing, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment
di: Haldar, Rajdeep, et al.
Pubblicazione: (2026)
di: Haldar, Rajdeep, et al.
Pubblicazione: (2026)
Adversarial Vulnerability as a Consequence of On-Manifold Inseparibility
di: Haldar, Rajdeep, et al.
Pubblicazione: (2024)
di: Haldar, Rajdeep, et al.
Pubblicazione: (2024)
Effect of Ambient-Intrinsic Dimension Gap on Adversarial Vulnerability
di: Haldar, Rajdeep, et al.
Pubblicazione: (2024)
di: Haldar, Rajdeep, et al.
Pubblicazione: (2024)
SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
Superficial Safety Alignment Hypothesis
di: Li, Jianwei, et al.
Pubblicazione: (2024)
di: Li, Jianwei, et al.
Pubblicazione: (2024)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
FFB: A Fair Fairness Benchmark for In-Processing Group Fairness Methods
di: Han, Xiaotian, et al.
Pubblicazione: (2023)
di: Han, Xiaotian, et al.
Pubblicazione: (2023)
Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey
di: Dong, Zhichen, et al.
Pubblicazione: (2024)
di: Dong, Zhichen, et al.
Pubblicazione: (2024)
Evaluating LLM Agent Adherence to Hierarchical Safety Principles: A Lightweight Benchmark for Probing Foundational Controllability Components
di: Potham, Ram
Pubblicazione: (2025)
di: Potham, Ram
Pubblicazione: (2025)
When the Domain Expert Has No Time and the LLM Developer Has No Clinical Expertise: Real-World Lessons from LLM Co-Design in a Safety-Net Hospital
di: Kothari, Avni, et al.
Pubblicazione: (2025)
di: Kothari, Avni, et al.
Pubblicazione: (2025)
Alignment as Jurisprudence
di: Caputo, Nicholas
Pubblicazione: (2026)
di: Caputo, Nicholas
Pubblicazione: (2026)
Generalized Discrete Diffusion with Self-Correction
di: Wang, Linxuan, et al.
Pubblicazione: (2026)
di: Wang, Linxuan, et al.
Pubblicazione: (2026)
International AI Safety Report
di: Bengio, Yoshua, et al.
Pubblicazione: (2025)
di: Bengio, Yoshua, et al.
Pubblicazione: (2025)
AI Alignment at Your Discretion
di: Buyl, Maarten, et al.
Pubblicazione: (2025)
di: Buyl, Maarten, et al.
Pubblicazione: (2025)
Pluralistic Alignment Over Time
di: Klassen, Toryn Q., et al.
Pubblicazione: (2024)
di: Klassen, Toryn Q., et al.
Pubblicazione: (2024)
Why Conclusions Diverge from the Same Observations: Formalizing World-Model Non-Identifiability via an Inference
di: Takahashi, Toru
Pubblicazione: (2026)
di: Takahashi, Toru
Pubblicazione: (2026)
An Approach to Technical AGI Safety and Security
di: Shah, Rohin, et al.
Pubblicazione: (2025)
di: Shah, Rohin, et al.
Pubblicazione: (2025)
Introduction to AI Safety, Ethics, and Society
di: Hendrycks, Dan
Pubblicazione: (2024)
di: Hendrycks, Dan
Pubblicazione: (2024)
Safety challenges of AI in medicine in the era of large language models
di: Wang, Xiaoye, et al.
Pubblicazione: (2024)
di: Wang, Xiaoye, et al.
Pubblicazione: (2024)
Open Problems in Machine Unlearning for AI Safety
di: Barez, Fazl, et al.
Pubblicazione: (2025)
di: Barez, Fazl, et al.
Pubblicazione: (2025)
Unified Uncertainty Estimation for Cognitive Diagnosis Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment
di: Lu, Allen, et al.
Pubblicazione: (2026)
di: Lu, Allen, et al.
Pubblicazione: (2026)
Defining and Evaluating Physical Safety for Large Language Models
di: Tang, Yung-Chen, et al.
Pubblicazione: (2024)
di: Tang, Yung-Chen, et al.
Pubblicazione: (2024)
An AI System Evaluation Framework for Advancing AI Safety: Terminology, Taxonomy, Lifecycle Mapping
di: Xia, Boming, et al.
Pubblicazione: (2024)
di: Xia, Boming, et al.
Pubblicazione: (2024)
Being Considerate as a Pathway Towards Pluralistic Alignment for Agentic AI
di: Alamdari, Parand A., et al.
Pubblicazione: (2024)
di: Alamdari, Parand A., et al.
Pubblicazione: (2024)
On Catastrophic Inheritance of Large Foundation Models
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations
di: Bowen, Dillon, et al.
Pubblicazione: (2025)
di: Bowen, Dillon, et al.
Pubblicazione: (2025)
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
di: Ren, Richard, et al.
Pubblicazione: (2024)
di: Ren, Richard, et al.
Pubblicazione: (2024)
NaiAD: Initiate Data-Driven Research for LLM Advertising
di: Zhang, Yihang, et al.
Pubblicazione: (2026)
di: Zhang, Yihang, et al.
Pubblicazione: (2026)
The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind
di: DeLeeuw, Caleb, et al.
Pubblicazione: (2025)
di: DeLeeuw, Caleb, et al.
Pubblicazione: (2025)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
di: Peng, Xiyue, et al.
Pubblicazione: (2024)
di: Peng, Xiyue, et al.
Pubblicazione: (2024)
Decolonial AI Alignment: Openness, Viśe\d{s}a-Dharma, and Including Excluded Knowledges
di: Varshney, Kush R.
Pubblicazione: (2023)
di: Varshney, Kush R.
Pubblicazione: (2023)
The Alignment Trap: Complexity Barriers
di: Yao, Jasper
Pubblicazione: (2025)
di: Yao, Jasper
Pubblicazione: (2025)
Assessing Social Alignment: Do Personality-Prompted Large Language Models Behave Like Humans?
di: Zakazov, Ivan, et al.
Pubblicazione: (2024)
di: Zakazov, Ivan, et al.
Pubblicazione: (2024)
Predicting Human Mobility during Extreme Events via LLM-Enhanced Cross-City Learning
di: Tang, Yinzhou, et al.
Pubblicazione: (2025)
di: Tang, Yinzhou, et al.
Pubblicazione: (2025)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
Chain-of-Thought Unfaithfulness as Disguised Accuracy
di: Bentham, Oliver, et al.
Pubblicazione: (2024)
di: Bentham, Oliver, et al.
Pubblicazione: (2024)
Documenti analoghi
-
f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment
di: Haldar, Rajdeep, et al.
Pubblicazione: (2026) -
Adversarial Vulnerability as a Consequence of On-Manifold Inseparibility
di: Haldar, Rajdeep, et al.
Pubblicazione: (2024) -
Effect of Ambient-Intrinsic Dimension Gap on Adversarial Vulnerability
di: Haldar, Rajdeep, et al.
Pubblicazione: (2024) -
SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions
di: Wang, Ziyi, et al.
Pubblicazione: (2025) -
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)