BraveGuard: From Open-World Threats to Safer Computer-Use Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Yunhao, Ding, Yifan, Du, Xiaohu, Wen, Ming, Deng, Xinhao, Guo, Yanming, Xie, Yuxiang, Zheng, Baihui, Tan, Yingshui, Li, Yige, Wu, Yutao, Wang, Yixu, Cao, Kerui, Huang, Wenke, Ma, Xingjun, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
par: Li, Juncheng, et autres
Publié: (2025)
par: Li, Juncheng, et autres
Publié: (2025)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
par: Jiang, Yilei, et autres
Publié: (2024)
par: Jiang, Yilei, et autres
Publié: (2024)
Brave Newold World.
par: Rettig, James
Publié: (1995)
par: Rettig, James
Publié: (1995)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
par: Yu, Jiaqi, et autres
Publié: (2026)
par: Yu, Jiaqi, et autres
Publié: (2026)
Information's Brave New World.
par: Malinconico, S. Michael
Publié: (1992)
par: Malinconico, S. Michael
Publié: (1992)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
par: Wu, Yutao, et autres
Publié: (2025)
par: Wu, Yutao, et autres
Publié: (2025)
A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5
par: Ma, Xingjun, et autres
Publié: (2026)
par: Ma, Xingjun, et autres
Publié: (2026)
Smartcards in Libraries: A Brave New World.
par: Myhill, Martin
Publié: (1998)
par: Myhill, Martin
Publié: (1998)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
par: Tan, Yingshui, et autres
Publié: (2024)
par: Tan, Yingshui, et autres
Publié: (2024)
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models
par: Zheng, Baihui, et autres
Publié: (2025)
par: Zheng, Baihui, et autres
Publié: (2025)
Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs
par: Zheng, Xiang, et autres
Publié: (2026)
par: Zheng, Xiang, et autres
Publié: (2026)
StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Brave.Net.World: The Internet as a Disinformation Superhighway?
par: Floridi, Luciano
Publié: (1996)
par: Floridi, Luciano
Publié: (1996)
Brave Humanism
par: Godfrey, Mollie
Publié: (2025)
par: Godfrey, Mollie
Publié: (2025)
Ode to the Brave
Extracting Training Data from Unconditional Diffusion Models
par: Chen, Yunhao, et autres
Publié: (2024)
par: Chen, Yunhao, et autres
Publié: (2024)
Expose Before You Defend: Unifying and Enhancing Backdoor Defenses via Exposed Models
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
par: Cui, Kaiyuan, et autres
Publié: (2026)
par: Cui, Kaiyuan, et autres
Publié: (2026)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
par: Chen, Yunhao, et autres
Publié: (2025)
par: Chen, Yunhao, et autres
Publié: (2025)
A Brave New World: The Impact of Technology on Innovation Management
par: Dhruv Grewal, et autres
Publié: (2025)
par: Dhruv Grewal, et autres
Publié: (2025)
The Governance of Well-being: Towards a “Brave New World”?
par: Alex Romaní Rivera
Publié: (2024)
par: Alex Romaní Rivera
Publié: (2024)
fastml: Guarded Resampling Workflows for Safer Automated Machine Learning in R
par: Korkmaz, Selcuk, et autres
Publié: (2026)
par: Korkmaz, Selcuk, et autres
Publié: (2026)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
par: Zhao, Yunhan, et autres
Publié: (2026)
par: Zhao, Yunhan, et autres
Publié: (2026)
Position: AI Safety Requires Effective Controllability
par: Li, Yige, et autres
Publié: (2026)
par: Li, Yige, et autres
Publié: (2026)
Braving Troubled Waters
par: van Ginkel, Rob
Publié: (2010)
par: van Ginkel, Rob
Publié: (2010)
Brave new family
Publié: (1999)
Publié: (1999)
Be Brave by Being Here
par: Julie Stivers
Publié: (2023)
par: Julie Stivers
Publié: (2023)
PurpCode: Reasoning for Safer Code Generation
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
New Liouville type theorems for the stationary Navier-Stokes equations
par: Tan, Wenke
Publié: (2025)
par: Tan, Wenke
Publié: (2025)
New Liouville type theorems for the stationary MHD equations in $\mathbb{R}^3$
par: Tan, Wenke
Publié: (2025)
par: Tan, Wenke
Publié: (2025)
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats
par: Deng, Xinhao, et autres
Publié: (2026)
par: Deng, Xinhao, et autres
Publié: (2026)
New Technologies and Old-Fashioned Economics: Creating a Brave New World for U.S. Government Information Distribution and Use.
par: Smith, Diane
Publié: (1999)
par: Smith, Diane
Publié: (1999)
Engineering a Safer World
par: Leveson, Nancy G.
Publié: (2019)
par: Leveson, Nancy G.
Publié: (2019)
HoneypotNet: Backdoor Attacks Against Model Extraction
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Brave Men / Ernie Pyle
par: Pyle, Ernie
Publié: (1939)
par: Pyle, Ernie
Publié: (1939)
Shortcuts Everywhere and Nowhere: Exploring Multi-Trigger Backdoor Attacks
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
par: Zhao, Yunhan, et autres
Publié: (2024)
par: Zhao, Yunhan, et autres
Publié: (2024)
Documents similaires
-
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026) -
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
par: Feng, Yunhao, et autres
Publié: (2026) -
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
par: Feng, Yunhao, et autres
Publié: (2026) -
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
par: Li, Juncheng, et autres
Publié: (2025) -
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
par: Jiang, Yilei, et autres
Publié: (2024)