Measuring Harmfulness of Computer-Using Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Aaron Xuxiang, Zhang, Ruofan, Tang, Janet, Wang, Ji, Shi, Tianyu, Wen, Jiaxin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MASH: Evading Black-Box AI-Generated Text Detectors via Style Humanization
par: Gu, Yongtong, et autres
Publié: (2026)
par: Gu, Yongtong, et autres
Publié: (2026)
Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption
par: Morales, Jaime, et autres
Publié: (2026)
par: Morales, Jaime, et autres
Publié: (2026)
AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models
par: Dawson, Ads, et autres
Publié: (2025)
par: Dawson, Ads, et autres
Publié: (2025)
Predicting Known Vulnerabilities from Attack Descriptions Using Sentence Transformers
par: Othman, Refat
Publié: (2026)
par: Othman, Refat
Publié: (2026)
Send to which account? Evaluation of an LLM-based Scambaiting System
par: Siadati, Hossein, et autres
Publié: (2025)
par: Siadati, Hossein, et autres
Publié: (2025)
Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps
par: Chona, Alankrit, et autres
Publié: (2026)
par: Chona, Alankrit, et autres
Publié: (2026)
A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts
par: Young, Richard J., et autres
Publié: (2026)
par: Young, Richard J., et autres
Publié: (2026)
Countermind: A Multi-Layered Security Architecture for Large Language Models
par: Schwarz, Dominik
Publié: (2025)
par: Schwarz, Dominik
Publié: (2025)
The Automation Advantage in AI Red Teaming
par: Mulla, Rob, et autres
Publié: (2025)
par: Mulla, Rob, et autres
Publié: (2025)
AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification
par: Zhang, Tian, et autres
Publié: (2026)
par: Zhang, Tian, et autres
Publié: (2026)
Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
par: Syed, Mohammed Sameer, et autres
Publié: (2026)
par: Syed, Mohammed Sameer, et autres
Publié: (2026)
Semantic Superiority vs. Forensic Efficiency: A Comparative Analysis of Deep Learning and Psycholinguistics for Business Email Compromise Detection
par: Adjei, Yaw Osei, et autres
Publié: (2025)
par: Adjei, Yaw Osei, et autres
Publié: (2025)
Towards Modeling Cybersecurity Behavior of Humans in Organizations
par: Kürtz, Klaas Ole
Publié: (2026)
par: Kürtz, Klaas Ole
Publié: (2026)
Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)
par: Young, Richard J., et autres
Publié: (2026)
par: Young, Richard J., et autres
Publié: (2026)
Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers
par: Wang, Haochuan Kevin, et autres
Publié: (2026)
par: Wang, Haochuan Kevin, et autres
Publié: (2026)
AegisShield: Democratizing Cyber Threat Modeling with Generative AI
par: Grofsky, Matthew
Publié: (2025)
par: Grofsky, Matthew
Publié: (2025)
Evaluating the Reliability of Digital Forensic Evidence Discovered by Large Language Model: A Case Study
par: Khatiwala, Jeel Piyushkumar, et autres
Publié: (2026)
par: Khatiwala, Jeel Piyushkumar, et autres
Publié: (2026)
Multilingual AI-Driven Password Strength Estimation with Similarity-Based Detection
par: Palaniappan, Nikitha M., et autres
Publié: (2026)
par: Palaniappan, Nikitha M., et autres
Publié: (2026)
Towards Agentic Investigation of Security Alerts
par: Eilertsen, Even, et autres
Publié: (2026)
par: Eilertsen, Even, et autres
Publié: (2026)
CritBench: A Framework for Evaluating Cybersecurity Capabilities of Large Language Models in IEC 61850 Digital Substation Environments
par: Keppler, Gustav, et autres
Publié: (2026)
par: Keppler, Gustav, et autres
Publié: (2026)
Amplifying Training Data Exposure through Fine-Tuning with Pseudo-Labeled Memberships
par: Oh, Myung Gyo, et autres
Publié: (2024)
par: Oh, Myung Gyo, et autres
Publié: (2024)
Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice
par: Ge, Yuxu
Publié: (2026)
par: Ge, Yuxu
Publié: (2026)
Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults
par: Usman, Rana Muhammad
Publié: (2026)
par: Usman, Rana Muhammad
Publié: (2026)
$δ$-STEAL: LLM Stealing Attack with Local Differential Privacy
par: Dang, Kieu, et autres
Publié: (2025)
par: Dang, Kieu, et autres
Publié: (2025)
SALLIE: Safeguarding Against Latent Language & Image Exploits
par: Azov, Guy, et autres
Publié: (2026)
par: Azov, Guy, et autres
Publié: (2026)
Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests
par: Young, Richard J., et autres
Publié: (2026)
par: Young, Richard J., et autres
Publié: (2026)
Adaptive Defense Orchestration for RAG: A Sentinel-Strategist Architecture against Multi-Vector Attacks
par: Pallerla, Pranav, et autres
Publié: (2026)
par: Pallerla, Pranav, et autres
Publié: (2026)
Sola-Visibility-ISPM: Benchmarking Agentic AI for Identity Security Posture Management Visibility
par: Engelberg, Gal, et autres
Publié: (2026)
par: Engelberg, Gal, et autres
Publié: (2026)
Toward Secure and Compliant AI: Organizational Standards and Protocols for NLP Model Lifecycle Management
par: Arora, Sunil, et autres
Publié: (2025)
par: Arora, Sunil, et autres
Publié: (2025)
SBASH: a Framework for Designing and Evaluating RAG vs. Prompt-Tuned LLM Honeypots
par: Adebimpe, Adetayo, et autres
Publié: (2025)
par: Adebimpe, Adetayo, et autres
Publié: (2025)
RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry
par: Lv, Bo, et autres
Publié: (2026)
par: Lv, Bo, et autres
Publié: (2026)
LLM Detectors Still Fall Short of Real World: Case of LLM-Generated Short News-Like Posts
par: Gameiro, Henrique Da Silva, et autres
Publié: (2024)
par: Gameiro, Henrique Da Silva, et autres
Publié: (2024)
Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection
par: Lelle, Travis
Publié: (2026)
par: Lelle, Travis
Publié: (2026)
Research on Security Enhancement Methods for Adversarial Robust Large Language Model Intelligent Agents for Medical Decision-Making Tasks
par: Hu, Saisai
Publié: (2026)
par: Hu, Saisai
Publié: (2026)
JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering
par: Chen, Renmiao, et autres
Publié: (2025)
par: Chen, Renmiao, et autres
Publié: (2025)
Whisper Leak: a side-channel attack on Large Language Models
par: McDonald, Geoff, et autres
Publié: (2025)
par: McDonald, Geoff, et autres
Publié: (2025)
Multi-Agent Honeypot-Based Request-Response Context Dataset for Improved SQL Injection Detection Performance
par: Yu, Hao, et autres
Publié: (2026)
par: Yu, Hao, et autres
Publié: (2026)
Retrieval Augmented Classification for Confidential Documents
par: Chang, Yeseul E., et autres
Publié: (2026)
par: Chang, Yeseul E., et autres
Publié: (2026)
Binary BPE: A Family of Cross-Platform Tokenizers for Binary Analysis
par: Bommarito II, Michael J.
Publié: (2025)
par: Bommarito II, Michael J.
Publié: (2025)
VectorSmuggle: Steganographic Exfiltration in Embedding Stores and a Cryptographic Provenance Defense
par: Wanger, Jascha
Publié: (2026)
par: Wanger, Jascha
Publié: (2026)
Documents similaires
-
MASH: Evading Black-Box AI-Generated Text Detectors via Style Humanization
par: Gu, Yongtong, et autres
Publié: (2026) -
Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption
par: Morales, Jaime, et autres
Publié: (2026) -
AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models
par: Dawson, Ads, et autres
Publié: (2025) -
Predicting Known Vulnerabilities from Attack Descriptions Using Sentence Transformers
par: Othman, Refat
Publié: (2026) -
Send to which account? Evaluation of an LLM-based Scambaiting System
par: Siadati, Hossein, et autres
Publié: (2025)