What is in Your Safe Data? Identifying Benign Data that Breaks Safety
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Luxi, Xia, Mengzhou, Henderson, Peter |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Adversarial Perspective on Machine Unlearning for AI Safety
por: Łucki, Jakub, et al.
Publicado: (2024)
por: Łucki, Jakub, et al.
Publicado: (2024)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
por: Zhang, Junbo, et al.
Publicado: (2026)
por: Zhang, Junbo, et al.
Publicado: (2026)
Intent Laundering: AI Safety Datasets Are Not What They Seem
por: Golchin, Shahriar, et al.
Publicado: (2026)
por: Golchin, Shahriar, et al.
Publicado: (2026)
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
por: Wang, Kun, et al.
Publicado: (2025)
por: Wang, Kun, et al.
Publicado: (2025)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
por: Li, Jianwei, et al.
Publicado: (2025)
por: Li, Jianwei, et al.
Publicado: (2025)
Do Phone-Use Agents Respect Your Privacy?
por: Tang, Zhengyang, et al.
Publicado: (2026)
por: Tang, Zhengyang, et al.
Publicado: (2026)
SecureBreak -- A dataset towards safe and secure models
por: Arazzi, Marco, et al.
Publicado: (2026)
por: Arazzi, Marco, et al.
Publicado: (2026)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
por: Min, Rui, et al.
Publicado: (2025)
por: Min, Rui, et al.
Publicado: (2025)
How Private is Your Attention? Bridging Privacy with In-Context Learning
por: Bonnerjee, Soham, et al.
Publicado: (2025)
por: Bonnerjee, Soham, et al.
Publicado: (2025)
MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?
por: Li, Xirui, et al.
Publicado: (2024)
por: Li, Xirui, et al.
Publicado: (2024)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
por: Cao, Bochuan, et al.
Publicado: (2023)
por: Cao, Bochuan, et al.
Publicado: (2023)
Lifelong Safety Alignment for Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Detecting Pretraining Data from Large Language Models
por: Shi, Weijia, et al.
Publicado: (2023)
por: Shi, Weijia, et al.
Publicado: (2023)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
por: Baumgärtner, Tim, et al.
Publicado: (2024)
por: Baumgärtner, Tim, et al.
Publicado: (2024)
HARMONIC: Harnessing LLMs for Tabular Data Synthesis and Privacy Protection
por: Wang, Yuxin, et al.
Publicado: (2024)
por: Wang, Yuxin, et al.
Publicado: (2024)
Evading Data Contamination Detection for Language Models is (too) Easy
por: Dekoninck, Jasper, et al.
Publicado: (2024)
por: Dekoninck, Jasper, et al.
Publicado: (2024)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
por: Wu, Xiaoyu, et al.
Publicado: (2025)
por: Wu, Xiaoyu, et al.
Publicado: (2025)
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
por: Wei, Zeming, et al.
Publicado: (2026)
por: Wei, Zeming, et al.
Publicado: (2026)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
por: Xu, Yijie, et al.
Publicado: (2025)
por: Xu, Yijie, et al.
Publicado: (2025)
Certifying LLM Safety against Adversarial Prompting
por: Kumar, Aounon, et al.
Publicado: (2023)
por: Kumar, Aounon, et al.
Publicado: (2023)
Detecting Training Data of Large Language Models via Expectation Maximization
por: Kim, Gyuwan, et al.
Publicado: (2024)
por: Kim, Gyuwan, et al.
Publicado: (2024)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
Extracting Training Data from Diffusion Language Models via Infilling
por: Wang, Yihan, et al.
Publicado: (2026)
por: Wang, Yihan, et al.
Publicado: (2026)
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
por: Xu, Xiaoyu, et al.
Publicado: (2026)
por: Xu, Xiaoyu, et al.
Publicado: (2026)
EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors
por: Banayeeanzade, Amin, et al.
Publicado: (2026)
por: Banayeeanzade, Amin, et al.
Publicado: (2026)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
por: Saiem, Bijoy Ahmed, et al.
Publicado: (2024)
por: Saiem, Bijoy Ahmed, et al.
Publicado: (2024)
On the Role of Attention Heads in Large Language Model Safety
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
Trustworthy AI: Safety, Bias, and Privacy -- A Survey
por: Fang, Xingli, et al.
Publicado: (2025)
por: Fang, Xingli, et al.
Publicado: (2025)
Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy
por: Wu, Tong, et al.
Publicado: (2024)
por: Wu, Tong, et al.
Publicado: (2024)
Privacy-Preserving Data Deduplication for Enhancing Federated Learning of Language Models (Extended Version)
por: Abadi, Aydin, et al.
Publicado: (2024)
por: Abadi, Aydin, et al.
Publicado: (2024)
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
por: Vega, Jason, et al.
Publicado: (2023)
por: Vega, Jason, et al.
Publicado: (2023)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
por: Gu, Tianle, et al.
Publicado: (2025)
por: Gu, Tianle, et al.
Publicado: (2025)
CPE-Identifier: Automated CPE identification and CVE summaries annotation with Deep Learning and NLP
por: Hu, Wanyu, et al.
Publicado: (2024)
por: Hu, Wanyu, et al.
Publicado: (2024)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
por: Bai, Yang, et al.
Publicado: (2024)
por: Bai, Yang, et al.
Publicado: (2024)
MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
por: Kan, Chun Yan Ryan, et al.
Publicado: (2026)
por: Kan, Chun Yan Ryan, et al.
Publicado: (2026)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities
por: Khattar, Vanshaj, et al.
Publicado: (2026)
por: Khattar, Vanshaj, et al.
Publicado: (2026)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
por: Qi, Zhenting, et al.
Publicado: (2024)
por: Qi, Zhenting, et al.
Publicado: (2024)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
por: Li, Lijun, et al.
Publicado: (2024)
por: Li, Lijun, et al.
Publicado: (2024)
Ejemplares similares
-
An Adversarial Perspective on Machine Unlearning for AI Safety
por: Łucki, Jakub, et al.
Publicado: (2024) -
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
por: Zhang, Junbo, et al.
Publicado: (2026) -
Intent Laundering: AI Safety Datasets Are Not What They Seem
por: Golchin, Shahriar, et al.
Publicado: (2026) -
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
por: Wang, Kun, et al.
Publicado: (2025) -
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
por: Li, Jianwei, et al.
Publicado: (2025)