From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Yuan, Sriskandarajah, Tina, Brakman, Anna-Luisa, Helyar, Alec, Beutel, Alex, Vallone, Andrea, Jain, Saachi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deliberative Alignment: Reasoning Enables Safer Language Models
por: Guan, Melody Y., et al.
Publicado: (2024)
por: Guan, Melody Y., et al.
Publicado: (2024)
Rule Based Rewards for Language Model Safety
por: Mu, Tong, et al.
Publicado: (2024)
por: Mu, Tong, et al.
Publicado: (2024)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
por: Yuan, Youliang, et al.
Publicado: (2024)
por: Yuan, Youliang, et al.
Publicado: (2024)
First-Person Fairness in Chatbots
por: Eloundou, Tyna, et al.
Publicado: (2024)
por: Eloundou, Tyna, et al.
Publicado: (2024)
From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law
por: Mavi, John, et al.
Publicado: (2025)
por: Mavi, John, et al.
Publicado: (2025)
HealthBench: Evaluating Large Language Models Towards Improved Human Health
por: Arora, Rahul K., et al.
Publicado: (2025)
por: Arora, Rahul K., et al.
Publicado: (2025)
Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding
por: Lee, Jin-Seop, et al.
Publicado: (2025)
por: Lee, Jin-Seop, et al.
Publicado: (2025)
Horizon-LM: A RAM-Centric Architecture for LLM Training
por: Yuan, Zhengqing, et al.
Publicado: (2026)
por: Yuan, Zhengqing, et al.
Publicado: (2026)
Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs
por: Yuan, Shuzhou, et al.
Publicado: (2025)
por: Yuan, Shuzhou, et al.
Publicado: (2025)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
por: Si, Shengyun, et al.
Publicado: (2025)
por: Si, Shengyun, et al.
Publicado: (2025)
Refusal Direction is Universal Across Safety-Aligned Languages
por: Wang, Xinpeng, et al.
Publicado: (2025)
por: Wang, Xinpeng, et al.
Publicado: (2025)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
por: Duan, Ranjie, et al.
Publicado: (2025)
por: Duan, Ranjie, et al.
Publicado: (2025)
Towards Next-Generation LLM Training: From the Data-Centric Perspective
por: Liang, Hao, et al.
Publicado: (2026)
por: Liang, Hao, et al.
Publicado: (2026)
"Even GPT Can Reject Me": Conceptualizing Abrupt Refusal Secondary Harm (ARSH) and Reimagining Psychological AI Safety with Compassionate Completion Standard (CCS)
por: Ni, Yang, et al.
Publicado: (2025)
por: Ni, Yang, et al.
Publicado: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
por: Jain, Neel, et al.
Publicado: (2024)
por: Jain, Neel, et al.
Publicado: (2024)
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
por: Chae, Kyubyung, et al.
Publicado: (2025)
por: Chae, Kyubyung, et al.
Publicado: (2025)
Should LLM Safety Be More Than Refusing Harmful Instructions?
por: Maskey, Utsav, et al.
Publicado: (2025)
por: Maskey, Utsav, et al.
Publicado: (2025)
Towards Solving NP-Complete and Other Hard Problems Efficiently in Practice
por: Digulescu, Mircea-Adrian
Publicado: (2026)
por: Digulescu, Mircea-Adrian
Publicado: (2026)
Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification
por: Im, Kyuri, et al.
Publicado: (2026)
por: Im, Kyuri, et al.
Publicado: (2026)
YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models
por: Yu, Yaman, et al.
Publicado: (2025)
por: Yu, Yaman, et al.
Publicado: (2025)
Latent Adversarial Training Improves the Representation of Refusal
por: Abbas, Alexandra, et al.
Publicado: (2025)
por: Abbas, Alexandra, et al.
Publicado: (2025)
SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering
por: Maskey, Utsav, et al.
Publicado: (2025)
por: Maskey, Utsav, et al.
Publicado: (2025)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
por: Asif, Sadia, et al.
Publicado: (2026)
por: Asif, Sadia, et al.
Publicado: (2026)
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
por: Wallace, Eric, et al.
Publicado: (2024)
por: Wallace, Eric, et al.
Publicado: (2024)
Enhancing Automated Interpretability with Output-Centric Feature Descriptions
por: Gur-Arieh, Yoav, et al.
Publicado: (2025)
por: Gur-Arieh, Yoav, et al.
Publicado: (2025)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
por: Zhang, Yuyou, et al.
Publicado: (2025)
por: Zhang, Yuyou, et al.
Publicado: (2025)
Data Debiasing with Datamodels (D3M): Improving Subgroup Robustness via Data Selection
por: Jain, Saachi, et al.
Publicado: (2024)
por: Jain, Saachi, et al.
Publicado: (2024)
QMA vs. QCMA and Pseudorandomness
por: Liu, Jiahui, et al.
Publicado: (2024)
por: Liu, Jiahui, et al.
Publicado: (2024)
Towards Exception Safety Code Generation with Intermediate Representation Agents Framework
por: Zhang, Xuanming, et al.
Publicado: (2024)
por: Zhang, Xuanming, et al.
Publicado: (2024)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
por: Wang, Siyin, et al.
Publicado: (2024)
por: Wang, Siyin, et al.
Publicado: (2024)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
por: Du, Yanrui, et al.
Publicado: (2025)
por: Du, Yanrui, et al.
Publicado: (2025)
Towards 3D Object-Centric Feature Learning for Semantic Scene Completion
por: Wang, Weihua, et al.
Publicado: (2025)
por: Wang, Weihua, et al.
Publicado: (2025)
SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Intervention
por: Wu, Jiaqi, et al.
Publicado: (2025)
por: Wu, Jiaqi, et al.
Publicado: (2025)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
por: Anonto, Riad Ahmed, et al.
Publicado: (2025)
por: Anonto, Riad Ahmed, et al.
Publicado: (2025)
Refusing Safe Prompts for Multi-modal Large Language Models
por: Shao, Zedian, et al.
Publicado: (2024)
por: Shao, Zedian, et al.
Publicado: (2024)
Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use
por: Agarwal, Aradhye, et al.
Publicado: (2026)
por: Agarwal, Aradhye, et al.
Publicado: (2026)
Learning to Refuse: Towards Mitigating Privacy Risks in LLMs
por: Liu, Zhenhua, et al.
Publicado: (2024)
por: Liu, Zhenhua, et al.
Publicado: (2024)
Does Refusal Training in LLMs Generalize to the Past Tense?
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
The new introduction to geographical economics / Steven Brakman, Harry Garretsen, Charles Van Merrewijk
por: Brakman, Steven
Publicado: (2001)
por: Brakman, Steven
Publicado: (2001)
Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning
por: Beutel, Alex, et al.
Publicado: (2024)
por: Beutel, Alex, et al.
Publicado: (2024)
Ejemplares similares
-
Deliberative Alignment: Reasoning Enables Safer Language Models
por: Guan, Melody Y., et al.
Publicado: (2024) -
Rule Based Rewards for Language Model Safety
por: Mu, Tong, et al.
Publicado: (2024) -
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
por: Yuan, Youliang, et al.
Publicado: (2024) -
First-Person Fairness in Chatbots
por: Eloundou, Tyna, et al.
Publicado: (2024) -
From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law
por: Mavi, John, et al.
Publicado: (2025)