Toward a Principled Framework for Agent Safety Measurement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Shuyi, Suri, Anshuman, Oprea, Alina, Tan, Cheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
par: Lin, Shuyi, et autres
Publié: (2025)
par: Lin, Shuyi, et autres
Publié: (2025)
Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security
par: Naseh, Ali, et autres
Publié: (2025)
par: Naseh, Ali, et autres
Publié: (2025)
Exploiting Leaderboards for Large-Scale Distribution of Malicious Models
par: Suri, Anshuman, et autres
Publié: (2025)
par: Suri, Anshuman, et autres
Publié: (2025)
SAGA: A Security Architecture for Governing AI Agentic Systems
par: Syros, Georgios, et autres
Publié: (2025)
par: Syros, Georgios, et autres
Publié: (2025)
DROP: Poison Dilution via Knowledge Distillation for Federated Learning
par: Syros, Georgios, et autres
Publié: (2025)
par: Syros, Georgios, et autres
Publié: (2025)
Identifying Models Behind Text-to-Image Leaderboards
par: Naseh, Ali, et autres
Publié: (2026)
par: Naseh, Ali, et autres
Publié: (2026)
Riddle Me This! Stealthy Membership Inference for Retrieval-Augmented Generation
par: Naseh, Ali, et autres
Publié: (2025)
par: Naseh, Ali, et autres
Publié: (2025)
SleeperNets: Universal Backdoor Poisoning Attacks Against Reinforcement Learning Agents
par: Rathbun, Ethan, et autres
Publié: (2024)
par: Rathbun, Ethan, et autres
Publié: (2024)
Do Parameters Reveal More than Loss for Membership Inference?
par: Suri, Anshuman, et autres
Publié: (2024)
par: Suri, Anshuman, et autres
Publié: (2024)
Reconstruction of Personally Identifiable Information from Supervised Finetuned Models
par: Furukawa, Sae, et autres
Publié: (2026)
par: Furukawa, Sae, et autres
Publié: (2026)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
par: Chaudhari, Harsh, et autres
Publié: (2024)
par: Chaudhari, Harsh, et autres
Publié: (2024)
Adversarial Inception Backdoor Attacks against Reinforcement Learning
par: Rathbun, Ethan, et autres
Publié: (2024)
par: Rathbun, Ethan, et autres
Publié: (2024)
Synthesizing Tight Privacy and Accuracy Bounds via Weighted Model Counting
par: Oakley, Lisa, et autres
Publié: (2024)
par: Oakley, Lisa, et autres
Publié: (2024)
Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning
par: Rathbun, Ethan, et autres
Publié: (2026)
par: Rathbun, Ethan, et autres
Publié: (2026)
Dissecting Distribution Inference
par: Suri, Anshuman, et autres
Publié: (2022)
par: Suri, Anshuman, et autres
Publié: (2022)
TMI! Finetuned Models Leak Private Information from their Pretraining Data
par: Abascal, John, et autres
Publié: (2023)
par: Abascal, John, et autres
Publié: (2023)
Syntax- and Compilation-Preserving Evasion of LLM Vulnerability Detectors
par: Sun, Luze, et autres
Publié: (2026)
par: Sun, Luze, et autres
Publié: (2026)
PoolFlip: A Multi-Agent Reinforcement Learning Security Environment for Cyber Defense
par: Cadet, Xavier, et autres
Publié: (2025)
par: Cadet, Xavier, et autres
Publié: (2025)
MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks
par: Syros, Georgios, et autres
Publié: (2026)
par: Syros, Georgios, et autres
Publié: (2026)
Who Owns This Agent? Tracing AI Agents Back to Their Owners
par: Chocron, Ruben, et autres
Publié: (2026)
par: Chocron, Ruben, et autres
Publié: (2026)
Attacks and Mitigations for Distributed Governance of Agentic AI under Byzantine Adversaries
par: Laws, Matthew D., et autres
Publié: (2026)
par: Laws, Matthew D., et autres
Publié: (2026)
Backdoor Attacks in Peer-to-Peer Federated Learning
par: Syros, Georgios, et autres
Publié: (2023)
par: Syros, Georgios, et autres
Publié: (2023)
Quant Fever, Reasoning Blackholes, Schrodinger's Compliance, and More: Probing GPT-OSS-20B
par: Lin, Shuyi, et autres
Publié: (2025)
par: Lin, Shuyi, et autres
Publié: (2025)
A Bayesian Approach to Membership Inference for Statistical Release
par: Oakley, Lisa, et autres
Publié: (2026)
par: Oakley, Lisa, et autres
Publié: (2026)
Black-Box Privacy Attacks on Shared Representations in Multitask Learning
par: Abascal, John, et autres
Publié: (2025)
par: Abascal, John, et autres
Publié: (2025)
Cascading Adversarial Bias from Injection to Distillation in Language Models
par: Chaudhari, Harsh, et autres
Publié: (2025)
par: Chaudhari, Harsh, et autres
Publié: (2025)
UTrace: Poisoning Forensics for Private Collaborative Learning
par: Rose, Evan, et autres
Publié: (2024)
par: Rose, Evan, et autres
Publié: (2024)
Measuring Safety Alignment Effects in Autonomous Security Agents
par: David, Isaac, et autres
Publié: (2026)
par: David, Isaac, et autres
Publié: (2026)
AgentRFC: Security Design Principles and Conformance Testing for Agent Protocols
par: Zheng, Shenghan, et autres
Publié: (2026)
par: Zheng, Shenghan, et autres
Publié: (2026)
ACE: A Security Architecture for LLM-Integrated App Systems
par: Li, Evan, et autres
Publié: (2025)
par: Li, Evan, et autres
Publié: (2025)
Towards Stronger Blockchains: Security Against Front-Running Attacks
par: Misra, Anshuman, et autres
Publié: (2023)
par: Misra, Anshuman, et autres
Publié: (2023)
Quantitative Resilience Modeling for Autonomous Cyber Defense
par: Cadet, Xavier, et autres
Publié: (2025)
par: Cadet, Xavier, et autres
Publié: (2025)
Towards Principled Analysis and Mitigation of Space Cyber Risks
par: Ear, Ekzhin
Publié: (2025)
par: Ear, Ekzhin
Publié: (2025)
Towards Principled Risk Scores for Space Cyber Risk Management
par: Ear, Ekzhin, et autres
Publié: (2024)
par: Ear, Ekzhin, et autres
Publié: (2024)
One-shot Empirical Privacy Estimation for Federated Learning
par: Andrew, Galen, et autres
Publié: (2023)
par: Andrew, Galen, et autres
Publié: (2023)
Towards Measuring the Traceability of Cryptocurrencies
par: Kelen, Domokos Miklós, et autres
Publié: (2022)
par: Kelen, Domokos Miklós, et autres
Publié: (2022)
Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models
par: Chaudhari, Harsh, et autres
Publié: (2026)
par: Chaudhari, Harsh, et autres
Publié: (2026)
Model-agnostic clean-label backdoor mitigation in cybersecurity environments
par: Severi, Giorgio, et autres
Publié: (2024)
par: Severi, Giorgio, et autres
Publié: (2024)
Beyond Epsilon: A Principled QIF Framework for Local Differential Privacy
par: Gonze, Ramon G., et autres
Publié: (2026)
par: Gonze, Ramon G., et autres
Publié: (2026)
MAGIQ: A Post-Quantum Multi-Agentic AI Governance System with Provable Security
par: Avizheh, Sepideh, et autres
Publié: (2026)
par: Avizheh, Sepideh, et autres
Publié: (2026)
Documents similaires
-
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
par: Lin, Shuyi, et autres
Publié: (2025) -
Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security
par: Naseh, Ali, et autres
Publié: (2025) -
Exploiting Leaderboards for Large-Scale Distribution of Malicious Models
par: Suri, Anshuman, et autres
Publié: (2025) -
SAGA: A Security Architecture for Governing AI Agentic Systems
par: Syros, Georgios, et autres
Publié: (2025) -
DROP: Poison Dilution via Knowledge Distillation for Federated Learning
par: Syros, Georgios, et autres
Publié: (2025)