Lightweight Safety Guardrails Using Fine-tuned BERT Embeddings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Aaron, Rana, Mansi, Stolcke, Andreas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fine-tuning the SwissBERT Encoder Model for Embedding Sentences and Documents
par: Grosjean, Juri, et autres
Publié: (2024)
par: Grosjean, Juri, et autres
Publié: (2024)
A Lightweight Explainable Guardrail for Prompt Safety
par: Islam, Md Asiful, et autres
Publié: (2026)
par: Islam, Md Asiful, et autres
Publié: (2026)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
par: Hsiung, Lei, et autres
Publié: (2025)
par: Hsiung, Lei, et autres
Publié: (2025)
REFINE on Scarce Data: Retrieval Enhancement through Fine-Tuning via Model Fusion of Embedding Models
par: Gupta, Ambuje, et autres
Publié: (2024)
par: Gupta, Ambuje, et autres
Publié: (2024)
Memorization of Named Entities in Fine-tuned BERT Models
par: Diera, Andor, et autres
Publié: (2022)
par: Diera, Andor, et autres
Publié: (2022)
ACL: Aligned Contrastive Learning Improves BERT and Multi-exit BERT Fine-tuning
par: Li, Liz, et autres
Publié: (2026)
par: Li, Liz, et autres
Publié: (2026)
Detecting Bias in Large Language Models: Fine-tuned KcBERT
par: Lee, J. K., et autres
Publié: (2024)
par: Lee, J. K., et autres
Publié: (2024)
Bypassing Safety Guardrails in LLMs Using Humor
par: Cisneros-Velarde, Pedro
Publié: (2025)
par: Cisneros-Velarde, Pedro
Publié: (2025)
Fine-tuning BERT with Bidirectional LSTM for Fine-grained Movie Reviews Sentiment Analysis
par: Nkhata, Gibson, et autres
Publié: (2025)
par: Nkhata, Gibson, et autres
Publié: (2025)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
par: Ilin, Aleksei, et autres
Publié: (2025)
par: Ilin, Aleksei, et autres
Publié: (2025)
Improving Sampling Methods for Fine-tuning SentenceBERT in Text Streams
par: Garcia, Cristiano Mesquita, et autres
Publié: (2024)
par: Garcia, Cristiano Mesquita, et autres
Publié: (2024)
Question-Answering System for Bangla: Fine-tuning BERT-Bangla for a Closed Domain
par: Roy, Subal Chandra, et autres
Publié: (2024)
par: Roy, Subal Chandra, et autres
Publié: (2024)
Improving Text Embeddings for Smaller Language Models Using Contrastive Fine-tuning
par: Ukarapol, Trapoom, et autres
Publié: (2024)
par: Ukarapol, Trapoom, et autres
Publié: (2024)
Few Dimensions are Enough: Fine-tuning BERT with Selected Dimensions Revealed Its Redundant Nature
par: Fukuhata, Shion, et autres
Publié: (2025)
par: Fukuhata, Shion, et autres
Publié: (2025)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Can We Use Probing to Better Understand Fine-tuning and Knowledge Distillation of the BERT NLU?
par: Hościłowicz, Jakub, et autres
Publié: (2023)
par: Hościłowicz, Jakub, et autres
Publié: (2023)
Biomedical Entity Linking for Dutch: Fine-tuning a Self-alignment BERT Model on an Automatically Generated Wikipedia Corpus
par: Hartendorp, Fons, et autres
Publié: (2024)
par: Hartendorp, Fons, et autres
Publié: (2024)
Slot Filling as a Reasoning Task for SpeechLLMs
par: Hacioglu, Kadri, et autres
Publié: (2025)
par: Hacioglu, Kadri, et autres
Publié: (2025)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
par: Chen, Shuo, et autres
Publié: (2025)
par: Chen, Shuo, et autres
Publié: (2025)
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
par: Wang, Yan, et autres
Publié: (2026)
par: Wang, Yan, et autres
Publié: (2026)
MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
par: Yang, Yahan, et autres
Publié: (2025)
par: Yang, Yahan, et autres
Publié: (2025)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
InvBERT: Reconstructing Text from Contextualized Word Embeddings by inverting the BERT pipeline
par: Kugler, Kai, et autres
Publié: (2021)
par: Kugler, Kai, et autres
Publié: (2021)
CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety
par: An, Heajun, et autres
Publié: (2026)
par: An, Heajun, et autres
Publié: (2026)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
par: Sreedhar, Makesh Narsimhan, et autres
Publié: (2025)
par: Sreedhar, Makesh Narsimhan, et autres
Publié: (2025)
Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering
par: Chiniya, Purva, et autres
Publié: (2026)
par: Chiniya, Purva, et autres
Publié: (2026)
CUE Vectors: Modular Training of Language Models Conditioned on Diverse Contextual Signals
par: Novotney, Scott, et autres
Publié: (2022)
par: Novotney, Scott, et autres
Publié: (2022)
What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
par: Jain, Samyak, et autres
Publié: (2024)
par: Jain, Samyak, et autres
Publié: (2024)
Harnessing Large Language Models: Fine-tuned BERT for Detecting Charismatic Leadership Tactics in Natural Language
par: Saeid, Yasser, et autres
Publié: (2024)
par: Saeid, Yasser, et autres
Publié: (2024)
PARA: Parameter-Efficient Fine-tuning with Prompt Aware Representation Adjustment
par: Liu, Zequan, et autres
Publié: (2025)
par: Liu, Zequan, et autres
Publié: (2025)
ColBERT: Using BERT Sentence Embedding in Parallel Neural Networks for Computational Humor
par: Annamoradnejad, Issa, et autres
Publié: (2020)
par: Annamoradnejad, Issa, et autres
Publié: (2020)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
SpeechLLMs for Large-scale Contextualized Zero-shot Slot Filling
par: Hacioglu, Kadri, et autres
Publié: (2025)
par: Hacioglu, Kadri, et autres
Publié: (2025)
iBERT: Interpretable Embeddings via Sense Decomposition
par: Anand, Vishal, et autres
Publié: (2025)
par: Anand, Vishal, et autres
Publié: (2025)
Topic mining based on fine-tuning Sentence-BERT and LDA
par: Li, Jianheng, et autres
Publié: (2025)
par: Li, Jianheng, et autres
Publié: (2025)
CWTM: Leveraging Contextualized Word Embeddings from BERT for Neural Topic Modeling
par: Fang, Zheng, et autres
Publié: (2023)
par: Fang, Zheng, et autres
Publié: (2023)
Zero-shot Slot Filling in the Age of LLMs for Dialogue Systems
par: Rana, Mansi, et autres
Publié: (2024)
par: Rana, Mansi, et autres
Publié: (2024)
Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety
par: Huang, Wei-Chieh, et autres
Publié: (2025)
par: Huang, Wei-Chieh, et autres
Publié: (2025)
GISTEmbed: Guided In-sample Selection of Training Negatives for Text Embedding Fine-tuning
par: Solatorio, Aivin V.
Publié: (2024)
par: Solatorio, Aivin V.
Publié: (2024)
Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning
par: Wang, Guoli, et autres
Publié: (2026)
par: Wang, Guoli, et autres
Publié: (2026)
Documents similaires
-
Fine-tuning the SwissBERT Encoder Model for Embedding Sentences and Documents
par: Grosjean, Juri, et autres
Publié: (2024) -
A Lightweight Explainable Guardrail for Prompt Safety
par: Islam, Md Asiful, et autres
Publié: (2026) -
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
par: Hsiung, Lei, et autres
Publié: (2025) -
REFINE on Scarce Data: Retrieval Enhancement through Fine-Tuning via Model Fusion of Embedding Models
par: Gupta, Ambuje, et autres
Publié: (2024) -
Memorization of Named Entities in Fine-tuned BERT Models
par: Diera, Andor, et autres
Publié: (2022)