ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zhaorun, Liu, Xun, Kang, Mintong, Zhang, Jiawei, Pan, Minzhou, Yang, Shuang, Li, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents
par: Chen, Zhaorun, et autres
Publié: (2026)
par: Chen, Zhaorun, et autres
Publié: (2026)
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
par: Zhou, Andy, et autres
Publié: (2025)
par: Zhou, Andy, et autres
Publié: (2025)
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
par: Zhang, Jiawei, et autres
Publié: (2025)
par: Zhang, Jiawei, et autres
Publié: (2025)
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
par: Xu, Peiyang, et autres
Publié: (2025)
par: Xu, Peiyang, et autres
Publié: (2025)
AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
par: Kang, Mintong, et autres
Publié: (2023)
par: Kang, Mintong, et autres
Publié: (2023)
Neural Honeytrace: Plug&Play Watermarking Framework against Model Extraction Attacks
par: Xu, Yixiao, et autres
Publié: (2025)
par: Xu, Yixiao, et autres
Publié: (2025)
$R^2$-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
par: Kang, Mintong, et autres
Publié: (2026)
par: Kang, Mintong, et autres
Publié: (2026)
ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning
par: Chen, Zhaorun, et autres
Publié: (2025)
par: Chen, Zhaorun, et autres
Publié: (2025)
Adaptive Multimodal Protein Plug-and-Play with Diffusion-Based Priors
par: Banerjee, Amartya, et autres
Publié: (2025)
par: Banerjee, Amartya, et autres
Publié: (2025)
Red Teaming Large Reasoning Models
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
par: Liao, Zeyi, et autres
Publié: (2024)
par: Liao, Zeyi, et autres
Publié: (2024)
MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks
par: Syros, Georgios, et autres
Publié: (2026)
par: Syros, Georgios, et autres
Publié: (2026)
Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
par: Deng, Yang, et autres
Publié: (2023)
par: Deng, Yang, et autres
Publié: (2023)
AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents
par: Li, Yanjie, et autres
Publié: (2025)
par: Li, Yanjie, et autres
Publié: (2025)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
par: Kang, Mintong, et autres
Publié: (2025)
par: Kang, Mintong, et autres
Publié: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
par: Dong, Jianshuo, et autres
Publié: (2025)
par: Dong, Jianshuo, et autres
Publié: (2025)
SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
STARK: Strategic Team of Agents for Refining Kernels
par: Dong, Juncheng, et autres
Publié: (2025)
par: Dong, Juncheng, et autres
Publié: (2025)
HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents
par: Lai, Huayi, et autres
Publié: (2026)
par: Lai, Huayi, et autres
Publié: (2026)
COLEP: Certifiably Robust Learning-Reasoning Conformal Prediction via Probabilistic Circuits
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
Semantic Representation Attack against Aligned Large Language Models
par: Lian, Jiawei, et autres
Publié: (2025)
par: Lian, Jiawei, et autres
Publié: (2025)
TS-Memory: Plug-and-Play Memory for Time Series Foundation Models
par: Lyu, Sisuo, et autres
Publié: (2026)
par: Lyu, Sisuo, et autres
Publié: (2026)
DISC: Plug-and-Play Decoding Intervention with Similarity of Characters for Chinese Spelling Check
par: Qiao, Ziheng, et autres
Publié: (2024)
par: Qiao, Ziheng, et autres
Publié: (2024)
Adaptive Contrast Adjustment Module: A Clinically-Inspired Plug-and-Play Approach for Enhanced Fetal Plane Classification
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
Certifiably Byzantine-Robust Federated Conformal Prediction
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
LLM-KT: Aligning Large Language Models with Knowledge Tracing using a Plug-and-Play Instruction
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
C-RAG: Certified Generation Risks for Retrieval-Augmented Language Models
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
par: Fang, Yixiong, et autres
Publié: (2024)
par: Fang, Yixiong, et autres
Publié: (2024)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
par: Xu, Huiyu, et autres
Publié: (2024)
par: Xu, Huiyu, et autres
Publié: (2024)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
par: Yao, Hongwei, et autres
Publié: (2026)
par: Yao, Hongwei, et autres
Publié: (2026)
Gradient Step Plug-and-Play Model for Dental Cone-Beam CT Reconstruction
par: Tatachak, Idris, et autres
Publié: (2026)
par: Tatachak, Idris, et autres
Publié: (2026)
Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
par: Cao, Jiaqi, et autres
Publié: (2025)
par: Cao, Jiaqi, et autres
Publié: (2025)
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Plug-and-Play Parameter-Efficient Tuning of Embeddings for Federated Recommendation
par: Yuan, Haochen, et autres
Publié: (2025)
par: Yuan, Haochen, et autres
Publié: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
par: Wang, Youze, et autres
Publié: (2025)
par: Wang, Youze, et autres
Publié: (2025)
Documents similaires
-
DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents
par: Chen, Zhaorun, et autres
Publié: (2026) -
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
par: Zhou, Andy, et autres
Publié: (2025) -
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
par: Zhang, Jiawei, et autres
Publié: (2025) -
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
par: Xu, Peiyang, et autres
Publié: (2025) -
AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models
par: Kang, Mintong, et autres
Publié: (2024)