Blue Teaming Function-Calling Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dolcetti, Greta, Zizzo, Giulio, Maffeis, Sergio |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
par: Belkhiter, Yannis, et autres
Publié: (2026)
par: Belkhiter, Yannis, et autres
Publié: (2026)
HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment
par: Belkhiter, Yannis, et autres
Publié: (2024)
par: Belkhiter, Yannis, et autres
Publié: (2024)
Elevating Defenses: Bridging Adversarial Training and Watermarking for Model Resilience
par: Thakkar, Janvi, et autres
Publié: (2023)
par: Thakkar, Janvi, et autres
Publié: (2023)
Towards a Practical Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via Randomized Smoothing
par: Gibert, Daniel, et autres
Publié: (2023)
par: Gibert, Daniel, et autres
Publié: (2023)
A Robust Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via (De)Randomized Smoothing
par: Gibert, Daniel, et autres
Publié: (2024)
par: Gibert, Daniel, et autres
Publié: (2024)
Assessing the Impact of Packing on Machine Learning-Based Malware Detection and Classification Systems
par: Gibert, Daniel, et autres
Publié: (2024)
par: Gibert, Daniel, et autres
Publié: (2024)
Towards Assuring EU AI Act Compliance and Adversarial Robustness of LLMs
par: Momcilovic, Tomas Bueno, et autres
Publié: (2024)
par: Momcilovic, Tomas Bueno, et autres
Publié: (2024)
Certified Adversarial Robustness of Machine Learning-based Malware Detectors via (De)Randomized Smoothing
par: Gibert, Daniel, et autres
Publié: (2024)
par: Gibert, Daniel, et autres
Publié: (2024)
Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting
par: Meng, Yuqiao, et autres
Publié: (2025)
par: Meng, Yuqiao, et autres
Publié: (2025)
Developing Assurance Cases for Adversarial Robustness and Regulatory Compliance in LLMs
par: Momcilovic, Tomas Bueno, et autres
Publié: (2024)
par: Momcilovic, Tomas Bueno, et autres
Publié: (2024)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
par: Rawat, Ambrish, et autres
Publié: (2024)
par: Rawat, Ambrish, et autres
Publié: (2024)
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
par: Cornacchia, Giandomenico, et autres
Publié: (2024)
par: Cornacchia, Giandomenico, et autres
Publié: (2024)
MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring
par: Jotautaitė, Monika, et autres
Publié: (2026)
par: Jotautaitė, Monika, et autres
Publié: (2026)
Causality Laundering: Denial-Feedback Leakage in Tool-Calling LLM Agents
par: Chinaei, Mohammad Hossein
Publié: (2026)
par: Chinaei, Mohammad Hossein
Publié: (2026)
The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models
par: Wu, Zihui, et autres
Publié: (2024)
par: Wu, Zihui, et autres
Publié: (2024)
Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems
par: Zhou, Zhaojiacheng
Publié: (2026)
par: Zhou, Zhaojiacheng
Publié: (2026)
Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents
par: Uchibeke, Uchi
Publié: (2026)
par: Uchibeke, Uchi
Publié: (2026)
MiniScope: A Least Privilege Framework for Authorizing Tool Calling Agents
par: Zhu, Jinhao, et autres
Publié: (2025)
par: Zhu, Jinhao, et autres
Publié: (2025)
Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection
par: Debi, Tanusree, et autres
Publié: (2026)
par: Debi, Tanusree, et autres
Publié: (2026)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
par: Yao, Hongwei, et autres
Publié: (2026)
par: Yao, Hongwei, et autres
Publié: (2026)
Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents
par: Zhou, Kaiyu, et autres
Publié: (2026)
par: Zhou, Kaiyu, et autres
Publié: (2026)
MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks
par: Syros, Georgios, et autres
Publié: (2026)
par: Syros, Georgios, et autres
Publié: (2026)
Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment
par: Xie, Yuchong, et autres
Publié: (2025)
par: Xie, Yuchong, et autres
Publié: (2025)
IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection
par: Chia-Pei, et autres
Publié: (2026)
par: Chia-Pei, et autres
Publié: (2026)
Red Teaming Large Reasoning Models
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools
par: Mohammadi, Bardia, et autres
Publié: (2026)
par: Mohammadi, Bardia, et autres
Publié: (2026)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
par: Xu, Huiyu, et autres
Publié: (2024)
par: Xu, Huiyu, et autres
Publié: (2024)
A Red Teaming Roadmap Towards System-Level Safety
par: Wang, Zifan, et autres
Publié: (2025)
par: Wang, Zifan, et autres
Publié: (2025)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
par: Lee, Hyomin, et autres
Publié: (2026)
par: Lee, Hyomin, et autres
Publié: (2026)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
par: Dong, Jianshuo, et autres
Publié: (2025)
par: Dong, Jianshuo, et autres
Publié: (2025)
UEChecker: Detecting Unchecked External Call Vulnerabilities in DApps via Graph Analysis
par: Kong, Dechao, et autres
Publié: (2025)
par: Kong, Dechao, et autres
Publié: (2025)
From Allies to Adversaries: Manipulating LLM Tool-Calling through Adversarial Injection
par: Wang, Haowei, et autres
Publié: (2024)
par: Wang, Haowei, et autres
Publié: (2024)
Red Teaming AI Red Teaming
par: Majumdar, Subhabrata, et autres
Publié: (2025)
par: Majumdar, Subhabrata, et autres
Publié: (2025)
Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours
par: Dheekonda, Raja Sekhar Rao, et autres
Publié: (2026)
par: Dheekonda, Raja Sekhar Rao, et autres
Publié: (2026)
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
par: Zhou, Andy, et autres
Publié: (2025)
par: Zhou, Andy, et autres
Publié: (2025)
Automatic Red Teaming LLM-based Agents with Model Context Protocol Tools
par: He, Ping, et autres
Publié: (2025)
par: He, Ping, et autres
Publié: (2025)
OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing
par: Chen, Jianming, et autres
Publié: (2026)
par: Chen, Jianming, et autres
Publié: (2026)
Incalmo: An Autonomous LLM-assisted System for Red Teaming Multi-Host Networks
par: Singer, Brian, et autres
Publié: (2025)
par: Singer, Brian, et autres
Publié: (2025)
BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing
par: Kaplan, Caelin, et autres
Publié: (2025)
par: Kaplan, Caelin, et autres
Publié: (2025)
A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications
par: Srivastava, Shruti, et autres
Publié: (2026)
par: Srivastava, Shruti, et autres
Publié: (2026)
Documents similaires
-
Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
par: Belkhiter, Yannis, et autres
Publié: (2026) -
HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment
par: Belkhiter, Yannis, et autres
Publié: (2024) -
Elevating Defenses: Bridging Adversarial Training and Watermarking for Model Resilience
par: Thakkar, Janvi, et autres
Publié: (2023) -
Towards a Practical Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via Randomized Smoothing
par: Gibert, Daniel, et autres
Publié: (2023) -
A Robust Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via (De)Randomized Smoothing
par: Gibert, Daniel, et autres
Publié: (2024)