Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zihan, Zhang, Rui, Liu, Yu, Liu, Chi, Zhao, Qingchuan, Li, Hongwei, Xu, Guowen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MPMA: Preference Manipulation Attack Against Model Context Protocol
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
Combinational Backdoor Attack against Customized Text-to-Image Models
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
"Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval
di: Li, Jiate, et al.
Pubblicazione: (2026)
di: Li, Jiate, et al.
Pubblicazione: (2026)
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
Black-Box Guardrail Reverse-engineering Attack
di: Yao, Hongwei, et al.
Pubblicazione: (2025)
di: Yao, Hongwei, et al.
Pubblicazione: (2025)
AdInject: Real-World Black-Box Attacks on Web Agents via Advertising Delivery
di: Wang, Haowei, et al.
Pubblicazione: (2025)
di: Wang, Haowei, et al.
Pubblicazione: (2025)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
OnePath: Efficient and Privacy-Preserving Decision Tree Inference in the Cloud
di: Yuan, Shuai, et al.
Pubblicazione: (2024)
di: Yuan, Shuai, et al.
Pubblicazione: (2024)
A Hard-Label Black-Box Evasion Attack against ML-based Malicious Traffic Detection Systems
di: Liu, Zixuan, et al.
Pubblicazione: (2025)
di: Liu, Zixuan, et al.
Pubblicazione: (2025)
Assessing Risk of Stealing Proprietary Models for Medical Imaging Tasks
di: Raj, Ankita, et al.
Pubblicazione: (2025)
di: Raj, Ankita, et al.
Pubblicazione: (2025)
Efficient Data-Free Model Stealing with Label Diversity
di: Liu, Yiyong, et al.
Pubblicazione: (2024)
di: Liu, Yiyong, et al.
Pubblicazione: (2024)
Backdoor Attacks against Image-to-Image Networks
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
di: Liu, Yiyong, et al.
Pubblicazione: (2026)
di: Liu, Yiyong, et al.
Pubblicazione: (2026)
GRID: Protecting Training Graph from Link Stealing Attacks on GNN Models
di: Lou, Jiadong, et al.
Pubblicazione: (2025)
di: Lou, Jiadong, et al.
Pubblicazione: (2025)
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
di: Liu, Yi, et al.
Pubblicazione: (2026)
di: Liu, Yi, et al.
Pubblicazione: (2026)
InputSnatch: Stealing Input in LLM Services via Timing Side-Channel Attacks
di: Zheng, Xinyao, et al.
Pubblicazione: (2024)
di: Zheng, Xinyao, et al.
Pubblicazione: (2024)
AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
di: Domico, Kyle, et al.
Pubblicazione: (2025)
di: Domico, Kyle, et al.
Pubblicazione: (2025)
Model Stealing Attack against Graph Classification with Authenticity, Uncertainty and Diversity
di: Zhu, Zhihao, et al.
Pubblicazione: (2023)
di: Zhu, Zhihao, et al.
Pubblicazione: (2023)
BESA: Boosting Encoder Stealing Attack with Perturbation Recovery
di: Ren, Xuhao, et al.
Pubblicazione: (2025)
di: Ren, Xuhao, et al.
Pubblicazione: (2025)
Stealing Trust: Unraveling Blind Message Attacks in Web3 Authentication
di: Yan, Kailun, et al.
Pubblicazione: (2024)
di: Yan, Kailun, et al.
Pubblicazione: (2024)
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
di: Duan, Zenghao, et al.
Pubblicazione: (2026)
di: Duan, Zenghao, et al.
Pubblicazione: (2026)
Prompt Stealing Attacks Against Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
When Skills Lie: Hidden-Comment Injection in LLM Agents
di: Wang, Qianli, et al.
Pubblicazione: (2026)
di: Wang, Qianli, et al.
Pubblicazione: (2026)
No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills
di: Li, Ying, et al.
Pubblicazione: (2026)
di: Li, Ying, et al.
Pubblicazione: (2026)
A Model Stealing Attack Against Multi-Exit Networks
di: Pan, Li, et al.
Pubblicazione: (2023)
di: Pan, Li, et al.
Pubblicazione: (2023)
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents
di: Wang, Zhun, et al.
Pubblicazione: (2025)
di: Wang, Zhun, et al.
Pubblicazione: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
di: Zhang, Rui, et al.
Pubblicazione: (2026)
di: Zhang, Rui, et al.
Pubblicazione: (2026)
Making Theft Useless: Adulteration-Based Protection of Proprietary Knowledge Graphs in GraphRAG Systems
di: Wang, Weijie, et al.
Pubblicazione: (2026)
di: Wang, Weijie, et al.
Pubblicazione: (2026)
PRSA: Prompt Stealing Attacks against Real-World Prompt Services
di: Yang, Yong, et al.
Pubblicazione: (2024)
di: Yang, Yong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MPMA: Preference Manipulation Attack Against Model Context Protocol
di: Wang, Zihan, et al.
Pubblicazione: (2025) -
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025) -
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025) -
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2026) -
Combinational Backdoor Attack against Customized Text-to-Image Models
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)