OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xin, Chen, Yunhao, Li, Juncheng, Wang, Yixu, Yao, Yang, Gu, Tianle, Li, Jie, Teng, Yan, Wang, Yingchun, Hu, Xia |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
par: Chen, Yunhao, et autres
Publié: (2025)
par: Chen, Yunhao, et autres
Publié: (2025)
HoneypotNet: Backdoor Attacks Against Model Extraction
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
par: Gu, Tianle, et autres
Publié: (2025)
par: Gu, Tianle, et autres
Publié: (2025)
StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Red Team Redemption: A Structured Comparison of Open-Source Tools for Adversary Emulation
par: Landauer, Max, et autres
Publié: (2024)
par: Landauer, Max, et autres
Publié: (2024)
FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption
par: Wang, Yanting, et autres
Publié: (2026)
par: Wang, Yanting, et autres
Publié: (2026)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
par: Gu, Tianle, et autres
Publié: (2024)
par: Gu, Tianle, et autres
Publié: (2024)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
par: Yao, Hongwei, et autres
Publié: (2026)
par: Yao, Hongwei, et autres
Publié: (2026)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
par: Yao, Yang, et autres
Publié: (2025)
par: Yao, Yang, et autres
Publié: (2025)
WAPITI: A Watermark for Finetuned Open-Source LLMs
par: Chen, Lingjie, et autres
Publié: (2024)
par: Chen, Lingjie, et autres
Publié: (2024)
Open Source, Open Threats? Investigating Security Challenges in Open-Source Software
par: Akhavani, Seyed Ali, et autres
Publié: (2025)
par: Akhavani, Seyed Ali, et autres
Publié: (2025)
Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
par: Li, Qinfeng, et autres
Publié: (2025)
par: Li, Qinfeng, et autres
Publié: (2025)
Towards Watermarking of Open-Source LLMs
par: Gloaguen, Thibaud, et autres
Publié: (2025)
par: Gloaguen, Thibaud, et autres
Publié: (2025)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
par: Liu, Yanjiang, et autres
Publié: (2025)
par: Liu, Yanjiang, et autres
Publié: (2025)
GuardPhish: Securing Open-Source LLMs from Phishing Abuse
par: Mishra, Rina, et autres
Publié: (2026)
par: Mishra, Rina, et autres
Publié: (2026)
MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP
par: Li, Ruiqi, et autres
Publié: (2026)
par: Li, Ruiqi, et autres
Publié: (2026)
ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation
par: Zhao, Haochen, et autres
Publié: (2026)
par: Zhao, Haochen, et autres
Publié: (2026)
Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs
par: Wang, Jiawen, et autres
Publié: (2025)
par: Wang, Jiawen, et autres
Publié: (2025)
HAL -- An Open-Source Framework for Gate-Level Netlist Analysis
par: Speith, Julian, et autres
Publié: (2025)
par: Speith, Julian, et autres
Publié: (2025)
Design and Implementation of an Open-Source Security Framework for Cloud Infrastructure
par: Shao, Wanru
Publié: (2026)
par: Shao, Wanru
Publié: (2026)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
par: You, Wenhao, et autres
Publié: (2025)
par: You, Wenhao, et autres
Publié: (2025)
An Analysis of Malicious Packages in Open-Source Software in the Wild
par: Zhou, Xiaoyan, et autres
Publié: (2024)
par: Zhou, Xiaoyan, et autres
Publié: (2024)
BraveGuard: From Open-World Threats to Safer Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming
par: Kumar, Anurakt, et autres
Publié: (2024)
par: Kumar, Anurakt, et autres
Publié: (2024)
When LLMs Team Up: A Coordinated Attack Framework for Automated Cyber Intrusions
par: Qi, Minfeng, et autres
Publié: (2026)
par: Qi, Minfeng, et autres
Publié: (2026)
From Promise to Peril: Rethinking Cybersecurity Red and Blue Teaming in the Age of LLMs
par: Abuadbba, Alsharif, et autres
Publié: (2025)
par: Abuadbba, Alsharif, et autres
Publié: (2025)
A Unified Open-Set Framework for Scalable PUF-Based Authentication of Heterogeneous IoT Devices
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
Synthesis of Sound and Precise Leakage Contracts for Open-Source RISC-V Processors
par: Wang, Zilong, et autres
Publié: (2025)
par: Wang, Zilong, et autres
Publié: (2025)
Ambush from All Sides: Understanding Security Threats in Open-Source Software CI/CD Pipelines
par: Pan, Ziyue, et autres
Publié: (2024)
par: Pan, Ziyue, et autres
Publié: (2024)
Pack-A-Mal: A Malware Analysis Framework for Open-Source Packages
par: Vu, Duc-Ly, et autres
Publié: (2025)
par: Vu, Duc-Ly, et autres
Publié: (2025)
NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs
par: Nguyen, Khoa, et autres
Publié: (2026)
par: Nguyen, Khoa, et autres
Publié: (2026)
MorphMark: Flexible Adaptive Watermarking for Large Language Models
par: Wang, Zongqi, et autres
Publié: (2025)
par: Wang, Zongqi, et autres
Publié: (2025)
OpenCCA: An Open Framework to Enable Arm CCA Research
par: Bertschi, Andrin, et autres
Publié: (2025)
par: Bertschi, Andrin, et autres
Publié: (2025)
A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)
par: Chen, Tianyu, et autres
Publié: (2026)
par: Chen, Tianyu, et autres
Publié: (2026)
Detecting Protracted Vulnerabilities in Open Source Projects
par: Sridharkumar, Arjun, et autres
Publié: (2026)
par: Sridharkumar, Arjun, et autres
Publié: (2026)
Red Teaming Methodology for Design Obfuscation
par: Liu, Yuntao, et autres
Publié: (2025)
par: Liu, Yuntao, et autres
Publié: (2025)
NeuroIDBench: An Open-Source Benchmark Framework for the Standardization of Methodology in Brainwave-based Authentication Research
par: Chaurasia, Avinash Kumar, et autres
Publié: (2024)
par: Chaurasia, Avinash Kumar, et autres
Publié: (2024)
Datenschutzkonformer LLM-Einsatz: Eine Open-Source-Referenzarchitektur
par: Lambert, Marian, et autres
Publié: (2025)
par: Lambert, Marian, et autres
Publié: (2025)
Private LoRA Fine-tuning of Open-Source LLMs with Homomorphic Encryption
par: Frery, Jordan, et autres
Publié: (2025)
par: Frery, Jordan, et autres
Publié: (2025)
GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?
par: Chen, Chiyu, et autres
Publié: (2025)
par: Chen, Chiyu, et autres
Publié: (2025)
Documents similaires
-
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
par: Chen, Yunhao, et autres
Publié: (2025) -
HoneypotNet: Backdoor Attacks Against Model Extraction
par: Wang, Yixu, et autres
Publié: (2025) -
Probing the Robustness of Large Language Models Safety to Latent Perturbations
par: Gu, Tianle, et autres
Publié: (2025) -
StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
par: Wang, Yixu, et autres
Publié: (2025) -
Red Team Redemption: A Structured Comparison of Open-Source Tools for Adversary Emulation
par: Landauer, Max, et autres
Publié: (2024)