Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Krishna, Kundan, Cheng, Joseph Y, Maalouf, Charles, Gatys, Leon A |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
por: Palaskar, Shruti, et al.
Publicado: (2025)
por: Palaskar, Shruti, et al.
Publicado: (2025)
Why Do Safety Guardrails Degrade Across Languages?
por: Zhang, Max, et al.
Publicado: (2026)
por: Zhang, Max, et al.
Publicado: (2026)
Test-Time Safety Alignment
por: Saglam, Baturay, et al.
Publicado: (2026)
por: Saglam, Baturay, et al.
Publicado: (2026)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
por: Shahani, Prithviraj Singh, et al.
Publicado: (2025)
por: Shahani, Prithviraj Singh, et al.
Publicado: (2025)
Understanding Annotator Safety Policy with Interpretability
por: Oesterling, Alex, et al.
Publicado: (2026)
por: Oesterling, Alex, et al.
Publicado: (2026)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
por: Ilin, Aleksei, et al.
Publicado: (2025)
por: Ilin, Aleksei, et al.
Publicado: (2025)
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
por: Oh, Sejoon, et al.
Publicado: (2024)
por: Oh, Sejoon, et al.
Publicado: (2024)
Test-Time Training Undermines Safety Guardrails
por: Antonelli, Simone, et al.
Publicado: (2026)
por: Antonelli, Simone, et al.
Publicado: (2026)
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
por: Ma, Rachel, et al.
Publicado: (2025)
por: Ma, Rachel, et al.
Publicado: (2025)
Unified Multi-Task Learning & Model Fusion for Efficient Language Model Guardrailing
por: Neill, James O', et al.
Publicado: (2025)
por: Neill, James O', et al.
Publicado: (2025)
Not All Adapters Matter: Selective Adapter Freezing for Memory-Efficient Fine-Tuning of Language Models
por: Son, Hyegang, et al.
Publicado: (2024)
por: Son, Hyegang, et al.
Publicado: (2024)
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
por: Gueorguieva, Anna-Maria, et al.
Publicado: (2025)
por: Gueorguieva, Anna-Maria, et al.
Publicado: (2025)
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
Learning to Reason for Hallucination Span Detection
por: Su, Hsuan, et al.
Publicado: (2025)
por: Su, Hsuan, et al.
Publicado: (2025)
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
por: Bobbili, Sarat Chandra, et al.
Publicado: (2025)
por: Bobbili, Sarat Chandra, et al.
Publicado: (2025)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
por: Elesedy, Hayder, et al.
Publicado: (2024)
por: Elesedy, Hayder, et al.
Publicado: (2024)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval
por: Zhang, Xin, et al.
Publicado: (2026)
por: Zhang, Xin, et al.
Publicado: (2026)
ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models
por: Singhal, Raghav, et al.
Publicado: (2025)
por: Singhal, Raghav, et al.
Publicado: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
por: Yang, Junxiao, et al.
Publicado: (2026)
por: Yang, Junxiao, et al.
Publicado: (2026)
Multilingual Safety Alignment via Self-Distillation
por: Qin, Ruiyang, et al.
Publicado: (2026)
por: Qin, Ruiyang, et al.
Publicado: (2026)
OrchMoE: Efficient Multi-Adapter Learning with Task-Skill Synergy
por: Wang, Haowen, et al.
Publicado: (2024)
por: Wang, Haowen, et al.
Publicado: (2024)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
MedualTime: A Dual-Adapter Language Model for Medical Time Series-Text Multimodal Learning
por: Ye, Jiexia, et al.
Publicado: (2024)
por: Ye, Jiexia, et al.
Publicado: (2024)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
por: Kang, Hao, et al.
Publicado: (2024)
por: Kang, Hao, et al.
Publicado: (2024)
BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate
por: Mazza, Arnon, et al.
Publicado: (2026)
por: Mazza, Arnon, et al.
Publicado: (2026)
Would I Lie To You? Inference Time Alignment of Language Models using Direct Preference Heads
por: Hadji-Kyriacou, Avelina Asada, et al.
Publicado: (2024)
por: Hadji-Kyriacou, Avelina Asada, et al.
Publicado: (2024)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
por: Qiu, Jiahao, et al.
Publicado: (2024)
por: Qiu, Jiahao, et al.
Publicado: (2024)
Course-Correction: Safety Alignment Using Synthetic Preferences
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
por: Huang, Yue, et al.
Publicado: (2025)
por: Huang, Yue, et al.
Publicado: (2025)
Compress to Impress: Efficient LLM Adaptation Using a Single Gradient Step on 100 Samples
por: Sreeram, Shiva, et al.
Publicado: (2025)
por: Sreeram, Shiva, et al.
Publicado: (2025)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
Filter-then-Generate: Large Language Models with Structure-Text Adapter for Knowledge Graph Completion
por: Liu, Ben, et al.
Publicado: (2024)
por: Liu, Ben, et al.
Publicado: (2024)
CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants
por: Sun, Albert Yu, et al.
Publicado: (2023)
por: Sun, Albert Yu, et al.
Publicado: (2023)
SafePred: A Predictive Guardrail for Computer-Using Agents via World Models
por: Chen, Yurun, et al.
Publicado: (2026)
por: Chen, Yurun, et al.
Publicado: (2026)
Sample-Efficient Alignment for LLMs
por: Liu, Zichen, et al.
Publicado: (2024)
por: Liu, Zichen, et al.
Publicado: (2024)
Ensembles of Low-Rank Expert Adapters
por: Li, Yinghao, et al.
Publicado: (2025)
por: Li, Yinghao, et al.
Publicado: (2025)
MoKA: Mixture of Kronecker Adapters
por: Sadeghi, Mohammadreza, et al.
Publicado: (2025)
por: Sadeghi, Mohammadreza, et al.
Publicado: (2025)
Random Initialization of Gated Sparse Adapters
por: Retault, Vi, et al.
Publicado: (2025)
por: Retault, Vi, et al.
Publicado: (2025)
Ejemplares similares
-
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
por: Palaskar, Shruti, et al.
Publicado: (2025) -
Why Do Safety Guardrails Degrade Across Languages?
por: Zhang, Max, et al.
Publicado: (2026) -
Test-Time Safety Alignment
por: Saglam, Baturay, et al.
Publicado: (2026) -
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
por: Shahani, Prithviraj Singh, et al.
Publicado: (2025) -
Understanding Annotator Safety Policy with Interpretability
por: Oesterling, Alex, et al.
Publicado: (2026)