Guardado en:
| Autores principales: | Egler, Sarah, Schulman, John, Carlini, Nicholas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.16255 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Audit-LLM: Multi-Agent Collaboration for Log-based Insider Threat Detection
por: Song, Chengyu, et al.
Publicado: (2024)
por: Song, Chengyu, et al.
Publicado: (2024)
Query-Based Adversarial Prompt Generation
por: Hayase, Jonathan, et al.
Publicado: (2024)
por: Hayase, Jonathan, et al.
Publicado: (2024)
FTSmartAudit: A Knowledge Distillation-Enhanced Framework for Automated Smart Contract Auditing Using Fine-Tuned LLMs
por: Wei, Zhiyuan, et al.
Publicado: (2024)
por: Wei, Zhiyuan, et al.
Publicado: (2024)
Case Study: Fine-tuning Small Language Models for Accurate and Private CWE Detection in Python Code
por: Bappy, Md. Azizul Hakim, et al.
Publicado: (2025)
por: Bappy, Md. Azizul Hakim, et al.
Publicado: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
AudAgent: Automated Auditing of Privacy Policy Compliance in AI Agents
por: Zheng, Ye, et al.
Publicado: (2025)
por: Zheng, Ye, et al.
Publicado: (2025)
Agent Audit: A Security Analysis System for LLM Agent Applications
por: Zhang, Haiyue, et al.
Publicado: (2026)
por: Zhang, Haiyue, et al.
Publicado: (2026)
SDD: Self-Degraded Defense against Malicious Fine-tuning
por: Chen, Zixuan, et al.
Publicado: (2025)
por: Chen, Zixuan, et al.
Publicado: (2025)
Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills
por: Lv, Lijia, et al.
Publicado: (2026)
por: Lv, Lijia, et al.
Publicado: (2026)
Polynomial Time Cryptanalytic Extraction of Deep Neural Networks in the Hard-Label Setting
por: Carlini, Nicholas, et al.
Publicado: (2024)
por: Carlini, Nicholas, et al.
Publicado: (2024)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
por: Zeng, Yi, et al.
Publicado: (2024)
por: Zeng, Yi, et al.
Publicado: (2024)
Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique
por: Li, Yanming, et al.
Publicado: (2025)
por: Li, Yanming, et al.
Publicado: (2025)
I can't see it but I can Fine-tune it: On Encrypted Fine-tuning of Transformers using Fully Homomorphic Encryption
por: Panzade, Prajwal, et al.
Publicado: (2024)
por: Panzade, Prajwal, et al.
Publicado: (2024)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
Automating Security Audit Using Large Language Model based Agent: An Exploration Experiment
por: Chin, Jia Hui, et al.
Publicado: (2025)
por: Chin, Jia Hui, et al.
Publicado: (2025)
PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say
por: Zhang, Mingxuan, et al.
Publicado: (2026)
por: Zhang, Mingxuan, et al.
Publicado: (2026)
DATABench: Evaluating Dataset Auditing in Deep Learning from an Adversarial Perspective
por: Shao, Shuo, et al.
Publicado: (2025)
por: Shao, Shuo, et al.
Publicado: (2025)
Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs
por: Liu, Ziyang
Publicado: (2026)
por: Liu, Ziyang
Publicado: (2026)
Zero-Knowledge Audit for Internet of Agents: Privacy-Preserving Communication Verification with Model Context Protocol
por: Jing, Guanlin, et al.
Publicado: (2025)
por: Jing, Guanlin, et al.
Publicado: (2025)
Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Symmetry Defeats Auditing
por: Merrill, Nick, et al.
Publicado: (2026)
por: Merrill, Nick, et al.
Publicado: (2026)
The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models
por: Xu, Zhiyuan, et al.
Publicado: (2025)
por: Xu, Zhiyuan, et al.
Publicado: (2025)
ESAA-Security: An Event-Sourced, Verifiable Architecture for Agent-Assisted Security Audits of AI-Generated Code
por: Filho, Elzo Brito dos Santos
Publicado: (2026)
por: Filho, Elzo Brito dos Santos
Publicado: (2026)
AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
por: Carlini, Nicholas, et al.
Publicado: (2025)
por: Carlini, Nicholas, et al.
Publicado: (2025)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
por: Chang, Chen-Wei, et al.
Publicado: (2025)
por: Chang, Chen-Wei, et al.
Publicado: (2025)
Persistent Pre-Training Poisoning of LLMs
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Token-level Data Selection for Safe LLM Fine-tuning
por: Li, Yanping, et al.
Publicado: (2026)
por: Li, Yanping, et al.
Publicado: (2026)
Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents
por: Das, Saswat, et al.
Publicado: (2025)
por: Das, Saswat, et al.
Publicado: (2025)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
por: Domico, Kyle, et al.
Publicado: (2025)
por: Domico, Kyle, et al.
Publicado: (2025)
Beyond Classification: Evaluating LLMs for Fine-Grained Automatic Malware Behavior Auditing
por: Zheng, Xinran, et al.
Publicado: (2025)
por: Zheng, Xinran, et al.
Publicado: (2025)
CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning
por: ElZemity, Adel, et al.
Publicado: (2025)
por: ElZemity, Adel, et al.
Publicado: (2025)
LLMs unlock new paths to monetizing exploits
por: Carlini, Nicholas, et al.
Publicado: (2025)
por: Carlini, Nicholas, et al.
Publicado: (2025)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
por: Cao, Tri, et al.
Publicado: (2026)
por: Cao, Tri, et al.
Publicado: (2026)
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
por: Li, Shen, et al.
Publicado: (2024)
por: Li, Shen, et al.
Publicado: (2024)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
por: Lu, Guoxin, et al.
Publicado: (2026)
por: Lu, Guoxin, et al.
Publicado: (2026)
Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection
por: Kulkarni, Prashant
Publicado: (2026)
por: Kulkarni, Prashant
Publicado: (2026)
Out-of-Distribution Detection for Neurosymbolic Autonomous Cyber Agents
por: Samaddar, Ankita, et al.
Publicado: (2024)
por: Samaddar, Ankita, et al.
Publicado: (2024)
Masked Language Model Based Textual Adversarial Example Detection
por: Zhang, Xiaomei, et al.
Publicado: (2023)
por: Zhang, Xiaomei, et al.
Publicado: (2023)
On the Evidentiary Limits of Membership Inference for Copyright Auditing
por: Ertan, Murat Bilgehan, et al.
Publicado: (2026)
por: Ertan, Murat Bilgehan, et al.
Publicado: (2026)
Malware Detection Through Memory Analysis
por: Nassar, Sarah
Publicado: (2026)
por: Nassar, Sarah
Publicado: (2026)
Ejemplares similares
-
Audit-LLM: Multi-Agent Collaboration for Log-based Insider Threat Detection
por: Song, Chengyu, et al.
Publicado: (2024) -
Query-Based Adversarial Prompt Generation
por: Hayase, Jonathan, et al.
Publicado: (2024) -
FTSmartAudit: A Knowledge Distillation-Enhanced Framework for Automated Smart Contract Auditing Using Fine-Tuned LLMs
por: Wei, Zhiyuan, et al.
Publicado: (2024) -
Case Study: Fine-tuning Small Language Models for Accurate and Private CWE Detection in Python Code
por: Bappy, Md. Azizul Hakim, et al.
Publicado: (2025) -
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
por: Huang, Tiansheng, et al.
Publicado: (2024)