Information Theoretic Adversarial Training of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yiwei, Birrell, Jeremiah, Ebrahimi, Reza, Behnia, Rouzbeh, Pacheco, Jason, Bertino, Elisa |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Differentially Private Stochastic Gradient Descent with Fixed-Size Minibatches: Tighter RDP Guarantees with or without Replacement
par: Birrell, Jeremiah, et autres
Publié: (2024)
par: Birrell, Jeremiah, et autres
Publié: (2024)
An Interactive Framework for Implementing Privacy-Preserving Federated Learning: Experiments on Large Language Models
par: Ahmadi, Kasra, et autres
Publié: (2025)
par: Ahmadi, Kasra, et autres
Publié: (2025)
Uncovering Attacks and Defenses in Secure Aggregation for Federated Deep Learning
par: Zhang, Yiwei, et autres
Publié: (2024)
par: Zhang, Yiwei, et autres
Publié: (2024)
RAG Security and Privacy: Formalizing the Threat Model and Attack Surface
par: Arzanipour, Atousa, et autres
Publié: (2025)
par: Arzanipour, Atousa, et autres
Publié: (2025)
Efficient Full-Stack Private Federated Deep Learning with Post-Quantum Security
par: Zhang, Yiwei, et autres
Publié: (2025)
par: Zhang, Yiwei, et autres
Publié: (2025)
Local Differential Privacy for Federated Learning with Fixed Memory Usage and Per-Client Privacy
par: Behnia, Rouzbeh, et autres
Publié: (2025)
par: Behnia, Rouzbeh, et autres
Publié: (2025)
Pandora's White-Box: Precise Training Data Detection and Extraction in Large Language Models
par: Wang, Jeffrey G., et autres
Publié: (2024)
par: Wang, Jeffrey G., et autres
Publié: (2024)
Standing Firm in 5G: A Single-Round, Dropout-Resilient Secure Aggregation for Federated Learning
par: Zhang, Yiwei, et autres
Publié: (2025)
par: Zhang, Yiwei, et autres
Publié: (2025)
Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
par: Raza, Ali, et autres
Publié: (2026)
par: Raza, Ali, et autres
Publié: (2026)
Research on Key Technologies for Cross-Cloud Federated Training of Large Language Models
par: Yang, Haowei, et autres
Publié: (2024)
par: Yang, Haowei, et autres
Publié: (2024)
Embedding Hidden Adversarial Capabilities in Pre-Trained Diffusion Models
par: Beerens, Lucas, et autres
Publié: (2025)
par: Beerens, Lucas, et autres
Publié: (2025)
Unsupervised Threat Hunting using Continuous Bag-of-Terms-and-Time (CBoTT)
par: Kayhan, Varol, et autres
Publié: (2024)
par: Kayhan, Varol, et autres
Publié: (2024)
Reconstructing Training Data from Adapter-based Federated Large Language Models
par: Chen, Silong, et autres
Publié: (2026)
par: Chen, Silong, et autres
Publié: (2026)
Disttack: Graph Adversarial Attacks Toward Distributed GNN Training
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training
par: Zhao, Mengnan, et autres
Publié: (2026)
par: Zhao, Mengnan, et autres
Publié: (2026)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Defending Against Unforeseen Failure Modes with Latent Adversarial Training
par: Casper, Stephen, et autres
Publié: (2024)
par: Casper, Stephen, et autres
Publié: (2024)
Large Language Models for Security Operations Centers: A Comprehensive Survey
par: Habibzadeh, Ali, et autres
Publié: (2025)
par: Habibzadeh, Ali, et autres
Publié: (2025)
LISAA: A Framework for Large Language Model Information Security Awareness Assessment
par: Cohen, Ofir, et autres
Publié: (2024)
par: Cohen, Ofir, et autres
Publié: (2024)
NPAT Null-Space Projected Adversarial Training Towards Zero Deterioration
par: Hu, Hanyi, et autres
Publié: (2024)
par: Hu, Hanyi, et autres
Publié: (2024)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
par: Liu, Fuqiang, et autres
Publié: (2024)
par: Liu, Fuqiang, et autres
Publié: (2024)
Adaptive PII Mitigation Framework for Large Language Models
par: Asthana, Shubhi, et autres
Publié: (2025)
par: Asthana, Shubhi, et autres
Publié: (2025)
Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection
par: Guo, Yihao, et autres
Publié: (2025)
par: Guo, Yihao, et autres
Publié: (2025)
Improving Clean Accuracy via a Tangent-Space Perspective on Adversarial Training
par: Yi, Bongsoo, et autres
Publié: (2024)
par: Yi, Bongsoo, et autres
Publié: (2024)
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
par: Wang, Yisen, et autres
Publié: (2025)
par: Wang, Yisen, et autres
Publié: (2025)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
par: Peng, Benji, et autres
Publié: (2024)
par: Peng, Benji, et autres
Publié: (2024)
Adversarial Text Purification: A Large Language Model Approach for Defense
par: Moraffah, Raha, et autres
Publié: (2024)
par: Moraffah, Raha, et autres
Publié: (2024)
Watermark Stealing in Large Language Models
par: Jovanović, Nikola, et autres
Publié: (2024)
par: Jovanović, Nikola, et autres
Publié: (2024)
Privacy Auditing of Large Language Models
par: Panda, Ashwinee, et autres
Publié: (2025)
par: Panda, Ashwinee, et autres
Publié: (2025)
Model-based Large Language Model Customization as Service
par: Wu, Zhaomin, et autres
Publié: (2024)
par: Wu, Zhaomin, et autres
Publié: (2024)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
par: Wu, Linyu, et autres
Publié: (2025)
par: Wu, Linyu, et autres
Publié: (2025)
RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models
par: Chugh, Rishit
Publié: (2026)
par: Chugh, Rishit
Publié: (2026)
Exploring the Secondary Risks of Large Language Models
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
Finetuning Large Language Models for Vulnerability Detection
par: Shestov, Alexey, et autres
Publié: (2024)
par: Shestov, Alexey, et autres
Publié: (2024)
Self-interpreting Adversarial Images
par: Zhang, Tingwei, et autres
Publié: (2024)
par: Zhang, Tingwei, et autres
Publié: (2024)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
par: Kong, Cong, et autres
Publié: (2024)
par: Kong, Cong, et autres
Publié: (2024)
Adversaries Can Misuse Combinations of Safe Models
par: Jones, Erik, et autres
Publié: (2024)
par: Jones, Erik, et autres
Publié: (2024)
MF-CLIP: Leveraging CLIP as Surrogate Models for No-box Adversarial Attacks
par: Zhang, Jiaming, et autres
Publié: (2023)
par: Zhang, Jiaming, et autres
Publié: (2023)
UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
par: Sun, Yuhao, et autres
Publié: (2025)
par: Sun, Yuhao, et autres
Publié: (2025)
Prompt Injection Attacks on Large Language Models in Oncology
par: Clusmann, Jan, et autres
Publié: (2024)
par: Clusmann, Jan, et autres
Publié: (2024)
Documents similaires
-
Differentially Private Stochastic Gradient Descent with Fixed-Size Minibatches: Tighter RDP Guarantees with or without Replacement
par: Birrell, Jeremiah, et autres
Publié: (2024) -
An Interactive Framework for Implementing Privacy-Preserving Federated Learning: Experiments on Large Language Models
par: Ahmadi, Kasra, et autres
Publié: (2025) -
Uncovering Attacks and Defenses in Secure Aggregation for Federated Deep Learning
par: Zhang, Yiwei, et autres
Publié: (2024) -
RAG Security and Privacy: Formalizing the Threat Model and Attack Surface
par: Arzanipour, Atousa, et autres
Publié: (2025) -
Efficient Full-Stack Private Federated Deep Learning with Post-Quantum Security
par: Zhang, Yiwei, et autres
Publié: (2025)