Enregistré dans:
| Auteurs principaux: | He, Xuanli, Sel, Bilgehan, Ali, Faizan, Bao, Jenny, Cunningham, Hoagy, Wei, Jerry |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.14865 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
par: Sel, Bilgehan, et autres
Publié: (2026)
par: Sel, Bilgehan, et autres
Publié: (2026)
Mitigating Jailbreaks with Intent-Aware LLMs
par: Yeo, Wei Jie, et autres
Publié: (2025)
par: Yeo, Wei Jie, et autres
Publié: (2025)
HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment
par: Belkhiter, Yannis, et autres
Publié: (2024)
par: Belkhiter, Yannis, et autres
Publié: (2024)
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
Cut the Deadwood Out: Backdoor Purification via Guided Module Substitution
par: Tong, Yao, et autres
Publié: (2024)
par: Tong, Yao, et autres
Publié: (2024)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
par: He, Xuanli, et autres
Publié: (2024)
par: He, Xuanli, et autres
Publié: (2024)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
par: Zhang, Chiyu, et autres
Publié: (2025)
par: Zhang, Chiyu, et autres
Publié: (2025)
Deep Research Brings Deeper Harm
par: Chen, Shuo, et autres
Publié: (2025)
par: Chen, Shuo, et autres
Publié: (2025)
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
par: Li, Linbao, et autres
Publié: (2025)
par: Li, Linbao, et autres
Publié: (2025)
Attacks on Third-Party APIs of Large Language Models
par: Zhao, Wanru, et autres
Publié: (2024)
par: Zhao, Wanru, et autres
Publié: (2024)
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
par: Chen, Yen-Shan, et autres
Publié: (2026)
par: Chen, Yen-Shan, et autres
Publié: (2026)
Defending against Backdoor Attacks via Module Switching
par: Li, Weijun, et autres
Publié: (2025)
par: Li, Weijun, et autres
Publié: (2025)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
par: Luo, Xuan, et autres
Publié: (2025)
par: Luo, Xuan, et autres
Publié: (2025)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
par: Wei, Zhang, et autres
Publié: (2025)
par: Wei, Zhang, et autres
Publié: (2025)
Decoupled Alignment for Robust Plug-and-Play Adaptation
par: Luo, Haozheng, et autres
Publié: (2024)
par: Luo, Haozheng, et autres
Publié: (2024)
Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts
par: Hastuti, Rochana Prih, et autres
Publié: (2025)
par: Hastuti, Rochana Prih, et autres
Publié: (2025)
Automatic Generation of Web Censorship Probe Lists
par: Tang, Jenny, et autres
Publié: (2024)
par: Tang, Jenny, et autres
Publié: (2024)
Do Reasoning LLMs Refuse What They Infer in Long Contexts?
par: Fu, Yu, et autres
Publié: (2026)
par: Fu, Yu, et autres
Publié: (2026)
TOSSS: a CVE-based Software Security Benchmark for Large Language Models
par: Damie, Marc, et autres
Publié: (2026)
par: Damie, Marc, et autres
Publié: (2026)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
par: Lu, Guoxin, et autres
Publié: (2026)
par: Lu, Guoxin, et autres
Publié: (2026)
DuFFin: A Dual-Level Fingerprinting Framework for LLMs IP Protection
par: Yan, Yuliang, et autres
Publié: (2025)
par: Yan, Yuliang, et autres
Publié: (2025)
Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics
par: Chrabąszcz, Maciej, et autres
Publié: (2026)
par: Chrabąszcz, Maciej, et autres
Publié: (2026)
garak: A Framework for Security Probing Large Language Models
par: Derczynski, Leon, et autres
Publié: (2024)
par: Derczynski, Leon, et autres
Publié: (2024)
Waterfall: Framework for Robust and Scalable Text Watermarking and Provenance for LLMs
par: Lau, Gregory Kang Ruey, et autres
Publié: (2024)
par: Lau, Gregory Kang Ruey, et autres
Publié: (2024)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
par: Shen, Xinjie, et autres
Publié: (2026)
par: Shen, Xinjie, et autres
Publié: (2026)
Helpful or Harmful? Exploring the Efficacy of Large Language Models for Online Grooming Prevention
par: Prosser, Ellie, et autres
Publié: (2024)
par: Prosser, Ellie, et autres
Publié: (2024)
Enhance Robustness of Language Models Against Variation Attack through Graph Integration
par: Xiong, Zi, et autres
Publié: (2024)
par: Xiong, Zi, et autres
Publié: (2024)
SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
par: Huo, Jiahao, et autres
Publié: (2026)
par: Huo, Jiahao, et autres
Publié: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
Token-Level Privacy in Large Language Models
par: Harel, Re'em, et autres
Publié: (2025)
par: Harel, Re'em, et autres
Publié: (2025)
Fingerprinting LLMs via Prompt Injection
par: Hu, Yuepeng, et autres
Publié: (2025)
par: Hu, Yuepeng, et autres
Publié: (2025)
LLMs for Domain Generation Algorithm Detection
par: La O, Reynier Leyva, et autres
Publié: (2024)
par: La O, Reynier Leyva, et autres
Publié: (2024)
Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks
par: Kabir, Md Rysul, et autres
Publié: (2026)
par: Kabir, Md Rysul, et autres
Publié: (2026)
GRAID: Synthetic Data Generation with Geometric Constraints and Multi-Agentic Reflection for Harmful Content Detection
par: Rad, Melissa Kazemi, et autres
Publié: (2025)
par: Rad, Melissa Kazemi, et autres
Publié: (2025)
SoK: Are Watermarks in LLMs Ready for Deployment?
par: Dang, Kieu, et autres
Publié: (2025)
par: Dang, Kieu, et autres
Publié: (2025)
Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level
par: Zeng, Xinyi, et autres
Publié: (2024)
par: Zeng, Xinyi, et autres
Publié: (2024)
Fast-MIA: Efficient and Scalable Membership Inference for LLMs
par: Takahashi, Hiromu, et autres
Publié: (2025)
par: Takahashi, Hiromu, et autres
Publié: (2025)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
par: Li, Yuexin, et autres
Publié: (2026)
par: Li, Yuexin, et autres
Publié: (2026)
When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
par: Jones, Jaylen, et autres
Publié: (2026)
par: Jones, Jaylen, et autres
Publié: (2026)
Documents similaires
-
Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
par: Sel, Bilgehan, et autres
Publié: (2026) -
Mitigating Jailbreaks with Intent-Aware LLMs
par: Yeo, Wei Jie, et autres
Publié: (2025) -
HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment
par: Belkhiter, Yannis, et autres
Publié: (2024) -
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
par: He, Xuanli, et autres
Publié: (2024) -
Cut the Deadwood Out: Backdoor Purification via Guided Module Substitution
par: Tong, Yao, et autres
Publié: (2024)