Adversaries Can Misuse Combinations of Safe Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jones, Erik, Dragan, Anca, Steinhardt, Jacob |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
kNN Classification of Malware Data Dependency Graph Features
von: Musgrave, John, et al.
Veröffentlicht: (2024)
von: Musgrave, John, et al.
Veröffentlicht: (2024)
MULTI-LF: A Continuous Learning Framework for Real-Time Malicious Traffic Detection in Multi-Environment Networks
von: Rustam, Furqan, et al.
Veröffentlicht: (2025)
von: Rustam, Furqan, et al.
Veröffentlicht: (2025)
Output Supervision Can Obfuscate the Chain of Thought
von: Drori, Jacob, et al.
Veröffentlicht: (2025)
von: Drori, Jacob, et al.
Veröffentlicht: (2025)
Benchmarking Misuse Mitigation Against Covert Adversaries
von: Brown, Davis, et al.
Veröffentlicht: (2025)
von: Brown, Davis, et al.
Veröffentlicht: (2025)
IoT-based Android Malware Detection Using Graph Neural Network With Adversarial Defense
von: Yumlembam, Rahul, et al.
Veröffentlicht: (2025)
von: Yumlembam, Rahul, et al.
Veröffentlicht: (2025)
Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
von: Halawi, Danny, et al.
Veröffentlicht: (2024)
von: Halawi, Danny, et al.
Veröffentlicht: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
von: Xu, Yijie, et al.
Veröffentlicht: (2025)
von: Xu, Yijie, et al.
Veröffentlicht: (2025)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
Generating Adversarial Point Clouds Using Diffusion Model
von: Zhao, Ruiyang, et al.
Veröffentlicht: (2025)
von: Zhao, Ruiyang, et al.
Veröffentlicht: (2025)
Information Theoretic Adversarial Training of Large Language Models
von: Zhang, Yiwei, et al.
Veröffentlicht: (2026)
von: Zhang, Yiwei, et al.
Veröffentlicht: (2026)
UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
von: Sun, Yuhao, et al.
Veröffentlicht: (2025)
von: Sun, Yuhao, et al.
Veröffentlicht: (2025)
Embedding Hidden Adversarial Capabilities in Pre-Trained Diffusion Models
von: Beerens, Lucas, et al.
Veröffentlicht: (2025)
von: Beerens, Lucas, et al.
Veröffentlicht: (2025)
Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
von: Thornton, Scott
Veröffentlicht: (2026)
von: Thornton, Scott
Veröffentlicht: (2026)
Exploring Privacy and Fairness Risks in Sharing Diffusion Models: An Adversarial Perspective
von: Luo, Xinjian, et al.
Veröffentlicht: (2024)
von: Luo, Xinjian, et al.
Veröffentlicht: (2024)
MF-CLIP: Leveraging CLIP as Surrogate Models for No-box Adversarial Attacks
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
PHANTOM: Progressive High-fidelity Adversarial Network for Threat Object Modeling
von: Al-Karaki, Jamal, et al.
Veröffentlicht: (2025)
von: Al-Karaki, Jamal, et al.
Veröffentlicht: (2025)
Modeling Behavioral Preferences of Cyber Adversaries Using Inverse Reinforcement Learning
von: Shinde, Aditya, et al.
Veröffentlicht: (2025)
von: Shinde, Aditya, et al.
Veröffentlicht: (2025)
Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection
von: Guo, Yihao, et al.
Veröffentlicht: (2025)
von: Guo, Yihao, et al.
Veröffentlicht: (2025)
Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
von: Raza, Ali, et al.
Veröffentlicht: (2026)
von: Raza, Ali, et al.
Veröffentlicht: (2026)
Vision Transformer with Adversarial Indicator Token against Adversarial Attacks in Radio Signal Classifications
von: Zhang, Lu, et al.
Veröffentlicht: (2025)
von: Zhang, Lu, et al.
Veröffentlicht: (2025)
Self-interpreting Adversarial Images
von: Zhang, Tingwei, et al.
Veröffentlicht: (2024)
von: Zhang, Tingwei, et al.
Veröffentlicht: (2024)
GenoArmory: A Unified Evaluation Framework for Adversarial Attacks on Genomic Foundation Models
von: Luo, Haozheng, et al.
Veröffentlicht: (2025)
von: Luo, Haozheng, et al.
Veröffentlicht: (2025)
Investigating the Impact of Quantization on Adversarial Robustness
von: Li, Qun, et al.
Veröffentlicht: (2024)
von: Li, Qun, et al.
Veröffentlicht: (2024)
Adversarial Machine Learning Threats to Spacecraft
von: Thummala, Rajiv, et al.
Veröffentlicht: (2024)
von: Thummala, Rajiv, et al.
Veröffentlicht: (2024)
Topological Signatures of Adversaries in Multimodal Alignments
von: Vu, Minh, et al.
Veröffentlicht: (2025)
von: Vu, Minh, et al.
Veröffentlicht: (2025)
Adversarial Illusions in Multi-Modal Embeddings
von: Zhang, Tingwei, et al.
Veröffentlicht: (2023)
von: Zhang, Tingwei, et al.
Veröffentlicht: (2023)
Are Robust LLM Fingerprints Adversarially Robust?
von: Nasery, Anshul, et al.
Veröffentlicht: (2025)
von: Nasery, Anshul, et al.
Veröffentlicht: (2025)
Black-box Adversarial Attacks on Network-wide Multi-step Traffic State Prediction Models
von: Poudel, Bibek, et al.
Veröffentlicht: (2021)
von: Poudel, Bibek, et al.
Veröffentlicht: (2021)
AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models
von: Li, Fengpeng, et al.
Veröffentlicht: (2026)
von: Li, Fengpeng, et al.
Veröffentlicht: (2026)
Recalling The Forgotten Class Memberships: Unlearned Models Can Be Noisy Labelers to Leak Privacy
von: Sui, Zhihao, et al.
Veröffentlicht: (2025)
von: Sui, Zhihao, et al.
Veröffentlicht: (2025)
Untargeted Adversarial Attack on Knowledge Graph Embeddings
von: Zhao, Tianzhe, et al.
Veröffentlicht: (2024)
von: Zhao, Tianzhe, et al.
Veröffentlicht: (2024)
Relationship between Uncertainty in DNNs and Adversarial Attacks
von: Ogonna, Mabel, et al.
Veröffentlicht: (2024)
von: Ogonna, Mabel, et al.
Veröffentlicht: (2024)
Diffusion-based Adversarial Purification for Intrusion Detection
von: Merzouk, Mohamed Amine, et al.
Veröffentlicht: (2024)
von: Merzouk, Mohamed Amine, et al.
Veröffentlicht: (2024)
Extending XReason: Formal Explanations for Adversarial Detection
von: Jemaa, Amira, et al.
Veröffentlicht: (2024)
von: Jemaa, Amira, et al.
Veröffentlicht: (2024)
Mitigating the Structural Bias in Graph Adversarial Defenses
von: Fang, Junyuan, et al.
Veröffentlicht: (2025)
von: Fang, Junyuan, et al.
Veröffentlicht: (2025)
On the Robustness of Bayesian Neural Networks to Adversarial Attacks
von: Bortolussi, Luca, et al.
Veröffentlicht: (2022)
von: Bortolussi, Luca, et al.
Veröffentlicht: (2022)
Adversarial Attacks on Transformers-Based Malware Detectors
von: Jakhotiya, Yash, et al.
Veröffentlicht: (2022)
von: Jakhotiya, Yash, et al.
Veröffentlicht: (2022)
BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2025)
PEAS: A Strategy for Crafting Transferable Adversarial Examples
von: Avraham, Bar, et al.
Veröffentlicht: (2024)
von: Avraham, Bar, et al.
Veröffentlicht: (2024)
Variational Randomized Smoothing for Sample-Wise Adversarial Robustness
von: Hase, Ryo, et al.
Veröffentlicht: (2024)
von: Hase, Ryo, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
kNN Classification of Malware Data Dependency Graph Features
von: Musgrave, John, et al.
Veröffentlicht: (2024) -
MULTI-LF: A Continuous Learning Framework for Real-Time Malicious Traffic Detection in Multi-Environment Networks
von: Rustam, Furqan, et al.
Veröffentlicht: (2025) -
Output Supervision Can Obfuscate the Chain of Thought
von: Drori, Jacob, et al.
Veröffentlicht: (2025) -
Benchmarking Misuse Mitigation Against Covert Adversaries
von: Brown, Davis, et al.
Veröffentlicht: (2025) -
IoT-based Android Malware Detection Using Graph Neural Network With Adversarial Defense
von: Yumlembam, Rahul, et al.
Veröffentlicht: (2025)