Towards Safe and Honest AI Agents with Neural Self-Other Overlap
Fuente:
arXiv
Salvato in:
| Autori principali: | Carauleanu, Marc, Vaiana, Michael, Rosenblatt, Judd, Berg, Cameron, de Lucena, Diogo Schwerz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking harmless refusals when fine-tuning foundation models
di: Pop, Florin, et al.
Pubblicazione: (2024)
di: Pop, Florin, et al.
Pubblicazione: (2024)
Large Language Models Report Subjective Experience Under Self-Referential Processing
di: Berg, Cameron, et al.
Pubblicazione: (2025)
di: Berg, Cameron, et al.
Pubblicazione: (2025)
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
di: Ristea, Dan, et al.
Pubblicazione: (2024)
di: Ristea, Dan, et al.
Pubblicazione: (2024)
Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills
di: Noever, David
Pubblicazione: (2025)
di: Noever, David
Pubblicazione: (2025)
Enhancing Guardrails for Safe and Secure Healthcare AI
di: Gangavarapu, Ananya
Pubblicazione: (2024)
di: Gangavarapu, Ananya
Pubblicazione: (2024)
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
di: Yin, Sheng, et al.
Pubblicazione: (2024)
di: Yin, Sheng, et al.
Pubblicazione: (2024)
Momentum Point-Perplexity Mechanics in Large Language Models
di: Tomaz, Lorenzo, et al.
Pubblicazione: (2025)
di: Tomaz, Lorenzo, et al.
Pubblicazione: (2025)
Toward a Unified Security Framework for AI Agents: Trust, Risk, and Liability
di: Mo, Jiayun, et al.
Pubblicazione: (2025)
di: Mo, Jiayun, et al.
Pubblicazione: (2025)
SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment
di: Lin, Xixun, et al.
Pubblicazione: (2026)
di: Lin, Xixun, et al.
Pubblicazione: (2026)
Fault Injection and Safe-Error Attack for Extraction of Embedded Neural Network Models
di: Hector, Kevin, et al.
Pubblicazione: (2023)
di: Hector, Kevin, et al.
Pubblicazione: (2023)
BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation
di: Jiang, Xiaochong, et al.
Pubblicazione: (2026)
di: Jiang, Xiaochong, et al.
Pubblicazione: (2026)
Security of AI Agents
di: He, Yifeng, et al.
Pubblicazione: (2024)
di: He, Yifeng, et al.
Pubblicazione: (2024)
Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
Secret Collusion among AI Agents: Multi-Agent Deception via Steganography
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)
LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild
di: Reworr, et al.
Pubblicazione: (2024)
di: Reworr, et al.
Pubblicazione: (2024)
AI Identity: Standards, Gaps, and Research Directions for AI Agents
di: Otsuka, Takumi, et al.
Pubblicazione: (2026)
di: Otsuka, Takumi, et al.
Pubblicazione: (2026)
The Hidden Dangers of Browsing AI Agents
di: Mudryi, Mykyta, et al.
Pubblicazione: (2025)
di: Mudryi, Mykyta, et al.
Pubblicazione: (2025)
Towards Anonymous Neural Network Inference
di: Peiyuan, Liao
Pubblicazione: (2025)
di: Peiyuan, Liao
Pubblicazione: (2025)
AudAgent: Automated Auditing of Privacy Policy Compliance in AI Agents
di: Zheng, Ye, et al.
Pubblicazione: (2025)
di: Zheng, Ye, et al.
Pubblicazione: (2025)
AgentWall: A Runtime Safety Layer for Local AI Agents
di: Aravind, Ashwin
Pubblicazione: (2026)
di: Aravind, Ashwin
Pubblicazione: (2026)
AgentWard: A Lifecycle Security Architecture for Autonomous AI Agents
di: Zhang, Yixiang, et al.
Pubblicazione: (2026)
di: Zhang, Yixiang, et al.
Pubblicazione: (2026)
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
di: Yang, Chenglin
Pubblicazione: (2026)
di: Yang, Chenglin
Pubblicazione: (2026)
Open Challenges in Multi-Agent Security: Towards Secure Systems of Interacting AI Agents
di: de Witt, Christian Schroeder, et al.
Pubblicazione: (2025)
di: de Witt, Christian Schroeder, et al.
Pubblicazione: (2025)
Securing AI Agents with Information-Flow Control
di: Costa, Manuel, et al.
Pubblicazione: (2025)
di: Costa, Manuel, et al.
Pubblicazione: (2025)
Progent: Securing AI Agents with Privilege Control
di: Shi, Tianneng, et al.
Pubblicazione: (2025)
di: Shi, Tianneng, et al.
Pubblicazione: (2025)
AI Agent Smart Contract Exploit Generation
di: Gervais, Arthur, et al.
Pubblicazione: (2025)
di: Gervais, Arthur, et al.
Pubblicazione: (2025)
Multi-Agent Penetration Testing AI for the Web
di: David, Isaac, et al.
Pubblicazione: (2025)
di: David, Isaac, et al.
Pubblicazione: (2025)
VET Your Agent: Towards Host-Independent Autonomy via Verifiable Execution Traces
di: Grigor, Artem, et al.
Pubblicazione: (2025)
di: Grigor, Artem, et al.
Pubblicazione: (2025)
Safeguarding AI Agents: Developing and Analyzing Safety Architectures
di: Domkundwar, Ishaan, et al.
Pubblicazione: (2024)
di: Domkundwar, Ishaan, et al.
Pubblicazione: (2024)
ClawLess: A Security Model of AI Agents
di: Lu, Hongyi, et al.
Pubblicazione: (2026)
di: Lu, Hongyi, et al.
Pubblicazione: (2026)
SoK: Security and Privacy of AI Agents for Blockchain
di: Romandini, Nicolò, et al.
Pubblicazione: (2025)
di: Romandini, Nicolò, et al.
Pubblicazione: (2025)
Securing AI Agents Against Prompt Injection Attacks
di: Ramakrishnan, Badrinath, et al.
Pubblicazione: (2025)
di: Ramakrishnan, Badrinath, et al.
Pubblicazione: (2025)
Emerging Cyber Attack Risks of Medical AI Agents
di: Qiu, Jianing, et al.
Pubblicazione: (2025)
di: Qiu, Jianing, et al.
Pubblicazione: (2025)
A Comparative Evaluation of AI Agent Security Guardrails
di: Li, Qi, et al.
Pubblicazione: (2026)
di: Li, Qi, et al.
Pubblicazione: (2026)
Automatically Attacking Software Reverse Engineering AI Agents
di: Crawford, Brian, et al.
Pubblicazione: (2026)
di: Crawford, Brian, et al.
Pubblicazione: (2026)
Engineering Robustness into Personal Agents with the AI Workflow Store
di: Geambasu, Roxana, et al.
Pubblicazione: (2026)
di: Geambasu, Roxana, et al.
Pubblicazione: (2026)
CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly
di: Fan, Yihe, et al.
Pubblicazione: (2026)
di: Fan, Yihe, et al.
Pubblicazione: (2026)
Towards Log Analysis with AI Agents: Cowrie Case Study
di: Karaarslan, Enis, et al.
Pubblicazione: (2025)
di: Karaarslan, Enis, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Rethinking harmless refusals when fine-tuning foundation models
di: Pop, Florin, et al.
Pubblicazione: (2024) -
Large Language Models Report Subjective Experience Under Self-Referential Processing
di: Berg, Cameron, et al.
Pubblicazione: (2025) -
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
di: Ristea, Dan, et al.
Pubblicazione: (2024) -
Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills
di: Noever, David
Pubblicazione: (2025) -
Enhancing Guardrails for Safe and Secure Healthcare AI
di: Gangavarapu, Ananya
Pubblicazione: (2024)