Guardado en:
| Autores principales: | Shen, Hongyuan, Zheng, Min, Wang, Jincheng, Zhao, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.20952 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Understanding Data Importance in Machine Learning Attacks: Does Valuable Data Pose Greater Harm?
por: Wen, Rui, et al.
Publicado: (2024)
por: Wen, Rui, et al.
Publicado: (2024)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
por: Shen, Xinyue, et al.
Publicado: (2023)
por: Shen, Xinyue, et al.
Publicado: (2023)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
por: Chao, Patrick, et al.
Publicado: (2024)
por: Chao, Patrick, et al.
Publicado: (2024)
JULI: Jailbreak Large Language Models by Self-Introspection
por: Wang, Jesson, et al.
Publicado: (2025)
por: Wang, Jesson, et al.
Publicado: (2025)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
por: Wang, Xiangwen, et al.
Publicado: (2026)
por: Wang, Xiangwen, et al.
Publicado: (2026)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
por: Li, Songze, et al.
Publicado: (2026)
por: Li, Songze, et al.
Publicado: (2026)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
por: Jia, Xiaojun, et al.
Publicado: (2024)
por: Jia, Xiaojun, et al.
Publicado: (2024)
Jailbreaking Large Language Models in Infinitely Many Ways
por: Goldstein, Oliver, et al.
Publicado: (2025)
por: Goldstein, Oliver, et al.
Publicado: (2025)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
por: Li, Xuan, et al.
Publicado: (2023)
por: Li, Xuan, et al.
Publicado: (2023)
Voice Jailbreak Attacks Against GPT-4o
por: Shen, Xinyue, et al.
Publicado: (2024)
por: Shen, Xinyue, et al.
Publicado: (2024)
TokenProber: Jailbreaking Text-to-image Models via Fine-grained Word Impact Analysis
por: Wang, Longtian, et al.
Publicado: (2025)
por: Wang, Longtian, et al.
Publicado: (2025)
FlashDP: Private Training Large Language Models with Efficient DP-SGD
por: Wang, Liangyu, et al.
Publicado: (2025)
por: Wang, Liangyu, et al.
Publicado: (2025)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
por: Li, Haodong, et al.
Publicado: (2024)
por: Li, Haodong, et al.
Publicado: (2024)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design
por: Eshuijs, Leon, et al.
Publicado: (2026)
por: Eshuijs, Leon, et al.
Publicado: (2026)
Mitigating Error Amplification in Fast Adversarial Training
por: Zhao, Mengnan, et al.
Publicado: (2026)
por: Zhao, Mengnan, et al.
Publicado: (2026)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
por: Liu, Guozhi, et al.
Publicado: (2025)
por: Liu, Guozhi, et al.
Publicado: (2025)
TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering
por: Thornton, Scott
Publicado: (2026)
por: Thornton, Scott
Publicado: (2026)
Differentially Private Subspace Fine-Tuning for Large Language Models
por: Zheng, Lele, et al.
Publicado: (2026)
por: Zheng, Lele, et al.
Publicado: (2026)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)
por: Reddy, Aashray, et al.
Publicado: (2025)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
por: Chen, Wenyu, et al.
Publicado: (2026)
por: Chen, Wenyu, et al.
Publicado: (2026)
Label Privacy in Split Learning for Large Models with Parameter-Efficient Training
por: Zmushko, Philip, et al.
Publicado: (2024)
por: Zmushko, Philip, et al.
Publicado: (2024)
Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
por: Fu, Shaopeng, et al.
Publicado: (2025)
por: Fu, Shaopeng, et al.
Publicado: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
por: Lochab, Anamika, et al.
Publicado: (2025)
por: Lochab, Anamika, et al.
Publicado: (2025)
Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models
por: Dong, Yingkai, et al.
Publicado: (2024)
por: Dong, Yingkai, et al.
Publicado: (2024)
Extracting Spatiotemporal Data from Gradients with Large Language Models
por: Zheng, Lele, et al.
Publicado: (2024)
por: Zheng, Lele, et al.
Publicado: (2024)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
por: Liang, Siyuan, et al.
Publicado: (2025)
por: Liang, Siyuan, et al.
Publicado: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
por: Chen, Guangke, et al.
Publicado: (2025)
por: Chen, Guangke, et al.
Publicado: (2025)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
por: Galinkin, Erick, et al.
Publicado: (2024)
por: Galinkin, Erick, et al.
Publicado: (2024)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
por: Yao, Yang, et al.
Publicado: (2025)
por: Yao, Yang, et al.
Publicado: (2025)
Sovereign Context Protocol: An Open Attribution Layer for Human-Generated Content in the Age of Large Language Models
por: Panchigar, Praneel, et al.
Publicado: (2026)
por: Panchigar, Praneel, et al.
Publicado: (2026)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
por: Lin, Runqi, et al.
Publicado: (2025)
por: Lin, Runqi, et al.
Publicado: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
por: Coalson, Zachary, et al.
Publicado: (2024)
por: Coalson, Zachary, et al.
Publicado: (2024)
A Fast, Performant, Secure Distributed Training Framework For Large Language Model
por: Huang, Wei, et al.
Publicado: (2024)
por: Huang, Wei, et al.
Publicado: (2024)
The Surprising Harmfulness of Benign Overfitting for Adversarial Robustness
por: Hao, Yifan, et al.
Publicado: (2024)
por: Hao, Yifan, et al.
Publicado: (2024)
GRAID: Synthetic Data Generation with Geometric Constraints and Multi-Agentic Reflection for Harmful Content Detection
por: Rad, Melissa Kazemi, et al.
Publicado: (2025)
por: Rad, Melissa Kazemi, et al.
Publicado: (2025)
Ejemplares similares
-
Understanding Data Importance in Machine Learning Attacks: Does Valuable Data Pose Greater Harm?
por: Wen, Rui, et al.
Publicado: (2024) -
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
por: Shen, Xinyue, et al.
Publicado: (2023) -
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
por: Chao, Patrick, et al.
Publicado: (2024) -
JULI: Jailbreak Large Language Models by Self-Introspection
por: Wang, Jesson, et al.
Publicado: (2025) -
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
por: Wang, Xiangwen, et al.
Publicado: (2026)