Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Panfilov, Alexander, Romov, Peter, Shilov, Igor, de Montjoye, Yves-Alexandre, Geiping, Jonas, Andriushchenko, Maksym |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Capability-Based Scaling Trends for LLM-Based Red-Teaming
par: Panfilov, Alexander, et autres
Publié: (2025)
par: Panfilov, Alexander, et autres
Publié: (2025)
Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
par: Terekhov, Mikhail, et autres
Publié: (2025)
par: Terekhov, Mikhail, et autres
Publié: (2025)
Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs
par: Panfilov, Alexander, et autres
Publié: (2025)
par: Panfilov, Alexander, et autres
Publié: (2025)
Sub-optimal Learning in Meta-Classifier Attacks: A Study of Membership Inference on Differentially Private Location Aggregates
par: Liu, Yuhan, et autres
Publié: (2024)
par: Liu, Yuhan, et autres
Publié: (2024)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Counterfactual Influence as a Distributional Quantity
par: Meeus, Matthieu, et autres
Publié: (2025)
par: Meeus, Matthieu, et autres
Publié: (2025)
SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It)
par: Meeus, Matthieu, et autres
Publié: (2024)
par: Meeus, Matthieu, et autres
Publié: (2024)
DeSIA: Attribute Inference Attacks Against Limited Fixed Aggregate Statistics
par: Mao, Yifeng, et autres
Publié: (2025)
par: Mao, Yifeng, et autres
Publié: (2025)
The Tail Tells All: Estimating Model-Level Membership Inference Vulnerability Without Reference Models
par: Dodd, Euodia, et autres
Publié: (2025)
par: Dodd, Euodia, et autres
Publié: (2025)
Free Record-Level Privacy Risk Evaluation Through Artifact-Based Methods
par: Pollock, Joseph, et autres
Publié: (2024)
par: Pollock, Joseph, et autres
Publié: (2024)
Copyright Traps for Large Language Models
par: Meeus, Matthieu, et autres
Publié: (2024)
par: Meeus, Matthieu, et autres
Publié: (2024)
Monitoring Decomposition Attacks in LLMs with Lightweight Sequential Monitors
par: Yueh-Han, Chen, et autres
Publié: (2025)
par: Yueh-Han, Chen, et autres
Publié: (2025)
QueryCheetah: Fast Automated Discovery of Attribute Inference Attacks Against Query-Based Systems
par: Stevanoski, Bozhidar, et autres
Publié: (2024)
par: Stevanoski, Bozhidar, et autres
Publié: (2024)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
par: Boreiko, Valentyn, et autres
Publié: (2024)
par: Boreiko, Valentyn, et autres
Publié: (2024)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
par: Yang, Xiaoxue, et autres
Publié: (2025)
par: Yang, Xiaoxue, et autres
Publié: (2025)
Synthetic is all you need: removing the auxiliary data assumption for membership inference attacks against synthetic data
par: Guépin, Florent, et autres
Publié: (2023)
par: Guépin, Florent, et autres
Publié: (2023)
Achilles' Heels: Vulnerable Record Identification in Synthetic Data Publishing
par: Meeus, Matthieu, et autres
Publié: (2023)
par: Meeus, Matthieu, et autres
Publié: (2023)
Adversarial Attacks against Windows PE Malware Detection: A Survey of the State-of-the-Art
par: Ling, Xiang, et autres
Publié: (2021)
par: Ling, Xiang, et autres
Publié: (2021)
Re-pseudonymization Strategies for Smart Meter Data Are Not Robust to Deep Learning Profiling Attacks
par: Cretu, Ana-Maria, et autres
Publié: (2024)
par: Cretu, Ana-Maria, et autres
Publié: (2024)
The DCR Delusion: Measuring the Privacy Risk of Synthetic Data
par: Yao, Zexi, et autres
Publié: (2025)
par: Yao, Zexi, et autres
Publié: (2025)
Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks
par: Schmotz, David, et autres
Publié: (2026)
par: Schmotz, David, et autres
Publié: (2026)
A Zero Auxiliary Knowledge Membership Inference Attack on Aggregate Location Data
par: Guan, Vincent, et autres
Publié: (2024)
par: Guan, Vincent, et autres
Publié: (2024)
RAT-Bench: A Comprehensive Benchmark for Text Anonymization
par: Krčo, Nataša, et autres
Publié: (2026)
par: Krčo, Nataša, et autres
Publié: (2026)
Lost in the Averages: A New Specific Setup to Evaluate Membership Inference Attacks Against Machine Learning Models
par: Krčo, Nataša, et autres
Publié: (2024)
par: Krčo, Nataša, et autres
Publié: (2024)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
par: Rando, Javier, et autres
Publié: (2024)
par: Rando, Javier, et autres
Publié: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
par: Li, Xiaohu, et autres
Publié: (2025)
par: Li, Xiaohu, et autres
Publié: (2025)
When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack
par: Sun, Zehan, et autres
Publié: (2026)
par: Sun, Zehan, et autres
Publié: (2026)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
par: Chang, Chen-Wei, et autres
Publié: (2025)
par: Chang, Chen-Wei, et autres
Publié: (2025)
Correlation inference attacks against machine learning models
par: Creţu, Ana-Maria, et autres
Publié: (2021)
par: Creţu, Ana-Maria, et autres
Publié: (2021)
NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist
par: Bertram, Johannes, et autres
Publié: (2026)
par: Bertram, Johannes, et autres
Publié: (2026)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
BELT: Old-School Backdoor Attacks can Evade the State-of-the-Art Defense with Backdoor Exclusivity Lifting
par: Qiu, Huming, et autres
Publié: (2023)
par: Qiu, Huming, et autres
Publié: (2023)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
par: Kang, Mintong, et autres
Publié: (2023)
par: Kang, Mintong, et autres
Publié: (2023)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
par: Ma, Jiachen, et autres
Publié: (2024)
par: Ma, Jiachen, et autres
Publié: (2024)
Exploring the limits of strong membership inference attacks on large language models
par: Hayes, Jamie, et autres
Publié: (2025)
par: Hayes, Jamie, et autres
Publié: (2025)
Enhancing Adversarial Resistance in LLMs with Recursion
par: Li, Bryan, et autres
Publié: (2024)
par: Li, Bryan, et autres
Publié: (2024)
A Systematic Survey of Model Extraction Attacks and Defenses: State-of-the-Art and Perspectives
par: Zhao, Kaixiang, et autres
Publié: (2025)
par: Zhao, Kaixiang, et autres
Publié: (2025)
Investigating the Effect of Misalignment on Membership Privacy in the White-box Setting
par: Cretu, Ana-Maria, et autres
Publié: (2023)
par: Cretu, Ana-Maria, et autres
Publié: (2023)
Integrated Simulation Framework for Adversarial Attacks on Autonomous Vehicles
par: Anagnostopoulos, Christos, et autres
Publié: (2025)
par: Anagnostopoulos, Christos, et autres
Publié: (2025)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
par: Jha, Pranav K
Publié: (2025)
par: Jha, Pranav K
Publié: (2025)
Documents similaires
-
Capability-Based Scaling Trends for LLM-Based Red-Teaming
par: Panfilov, Alexander, et autres
Publié: (2025) -
Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
par: Terekhov, Mikhail, et autres
Publié: (2025) -
Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs
par: Panfilov, Alexander, et autres
Publié: (2025) -
Sub-optimal Learning in Meta-Classifier Attacks: A Study of Membership Inference on Differentially Private Location Aggregates
par: Liu, Yuhan, et autres
Publié: (2024) -
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
par: Andriushchenko, Maksym, et autres
Publié: (2024)