SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do
Fuente:
arXiv
Salvato in:
| Autori principali: | Dhodapkar, Aditya, Pishori, Farhaan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Futurity as Infrastructure: A Techno-Philosophical Interpretation of the AI Lifecycle
di: Cote, Mark, et al.
Pubblicazione: (2025)
di: Cote, Mark, et al.
Pubblicazione: (2025)
Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents
di: Ravindran, Santhosh Kumar
Pubblicazione: (2026)
di: Ravindran, Santhosh Kumar
Pubblicazione: (2026)
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026)
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026)
From Safety Risk to Design Principle: Peer-Preservation in Multi-Agent LLM Systems and Its Implications for Orchestrated Democratic Discourse Analysis
di: Dietrich, Juergen
Pubblicazione: (2026)
di: Dietrich, Juergen
Pubblicazione: (2026)
Privacy as Commodity: MFG-RegretNet for Large-Scale Privacy Trading in Federated Learning
di: Sun, Kangkang, et al.
Pubblicazione: (2026)
di: Sun, Kangkang, et al.
Pubblicazione: (2026)
HybridVFL: Disentangled Feature Learning for Edge-Enabled Vertical Federated Multimodal Classification
di: Anoosha, Mostafa, et al.
Pubblicazione: (2025)
di: Anoosha, Mostafa, et al.
Pubblicazione: (2025)
FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning
di: Zhang, Su, et al.
Pubblicazione: (2026)
di: Zhang, Su, et al.
Pubblicazione: (2026)
AI Agents: Evolution, Architecture, and Real-World Applications
di: Krishnan, Naveen
Pubblicazione: (2025)
di: Krishnan, Naveen
Pubblicazione: (2025)
When the Agent Is the Adversary: Architectural Requirements for Agentic AI Containment After the April 2026 Frontier Model Escape
di: Mitchell, Richard Joseph
Pubblicazione: (2026)
di: Mitchell, Richard Joseph
Pubblicazione: (2026)
IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol
di: Yao, Yunhao, et al.
Pubblicazione: (2025)
di: Yao, Yunhao, et al.
Pubblicazione: (2025)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
di: Tang, Wenjie, et al.
Pubblicazione: (2026)
di: Tang, Wenjie, et al.
Pubblicazione: (2026)
How Worrying Are Privacy Attacks Against Machine Learning?
di: Domingo-Ferrer, Josep
Pubblicazione: (2025)
di: Domingo-Ferrer, Josep
Pubblicazione: (2025)
Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents
di: Naik, Akshat, et al.
Pubblicazione: (2025)
di: Naik, Akshat, et al.
Pubblicazione: (2025)
Adaptive Minds: Empowering Agents with LoRA-as-Tools
di: Shekar, Pavan C, et al.
Pubblicazione: (2025)
di: Shekar, Pavan C, et al.
Pubblicazione: (2025)
Territory Paint Wars: Diagnosing and Mitigating Failure Modes in Competitive Multi-Agent PPO
di: Singh, Diyansha
Pubblicazione: (2026)
di: Singh, Diyansha
Pubblicazione: (2026)
Securing Federated Sensitive Topic Classification against Poisoning Attacks
di: Chu, Tianyue, et al.
Pubblicazione: (2022)
di: Chu, Tianyue, et al.
Pubblicazione: (2022)
Sovereign-OS: A Charter-Governed Operating System for Autonomous AI Agents with Verifiable Fiscal Discipline
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity
di: Rashidi, Mohammadreza
Pubblicazione: (2026)
di: Rashidi, Mohammadreza
Pubblicazione: (2026)
Memory-Augmented State Machine Prompting: A Novel LLM Agent Framework for Real-Time Strategy Games
di: Qi, Runnan, et al.
Pubblicazione: (2025)
di: Qi, Runnan, et al.
Pubblicazione: (2025)
Digital Forgetting in Large Language Models: A Survey of Unlearning Methods
di: Blanco-Justicia, Alberto, et al.
Pubblicazione: (2024)
di: Blanco-Justicia, Alberto, et al.
Pubblicazione: (2024)
On the Fundamental Limitations of Decentralized Learnable Reward Shaping in Cooperative Multi-Agent Reinforcement Learning
di: Akella, Aditya
Pubblicazione: (2025)
di: Akella, Aditya
Pubblicazione: (2025)
NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
di: Jia, Xiao
Pubblicazione: (2026)
di: Jia, Xiao
Pubblicazione: (2026)
PAC-DP: Personalized Adaptive Clipping for Differentially Private Federated Learning
di: Zhou, Hao, et al.
Pubblicazione: (2026)
di: Zhou, Hao, et al.
Pubblicazione: (2026)
Quantigence: A Multi-Agent AI Framework for Quantum Security Research
di: Alquwayfili, Abdulmalik
Pubblicazione: (2025)
di: Alquwayfili, Abdulmalik
Pubblicazione: (2025)
Your Data, My Model: Learning Who Really Helps in Federated Learning
di: Abdurakhmanova, Shamsiiat, et al.
Pubblicazione: (2024)
di: Abdurakhmanova, Shamsiiat, et al.
Pubblicazione: (2024)
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks
di: Padia, Soham, et al.
Pubblicazione: (2025)
di: Padia, Soham, et al.
Pubblicazione: (2025)
Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design
di: Pepe, Alberto, et al.
Pubblicazione: (2026)
di: Pepe, Alberto, et al.
Pubblicazione: (2026)
A collaborative ensemble construction method for federated random forest
di: Lim, Penjan Antonio Eng, et al.
Pubblicazione: (2024)
di: Lim, Penjan Antonio Eng, et al.
Pubblicazione: (2024)
CyberAId: AI-Driven Cybersecurity for Financial Service Providers
di: Fatouros, George, et al.
Pubblicazione: (2026)
di: Fatouros, George, et al.
Pubblicazione: (2026)
MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures
di: Zamaraeva, Elena, et al.
Pubblicazione: (2025)
di: Zamaraeva, Elena, et al.
Pubblicazione: (2025)
Adaptive Latent-Space Constraints in Personalized Federated Learning
di: Ayromlou, Sana, et al.
Pubblicazione: (2025)
di: Ayromlou, Sana, et al.
Pubblicazione: (2025)
AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence
di: Yu, Geunbin
Pubblicazione: (2026)
di: Yu, Geunbin
Pubblicazione: (2026)
Evaluation of Differential Privacy Mechanisms on Federated Learning
di: Varsani, Tejash
Pubblicazione: (2025)
di: Varsani, Tejash
Pubblicazione: (2025)
From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents
di: Wang, Xinyue, et al.
Pubblicazione: (2026)
di: Wang, Xinyue, et al.
Pubblicazione: (2026)
Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems
di: Berman, Shmuel, et al.
Pubblicazione: (2024)
di: Berman, Shmuel, et al.
Pubblicazione: (2024)
Client-Conditional Federated Learning via Local Training Data Statistics
di: Brännvall, Rickard
Pubblicazione: (2026)
di: Brännvall, Rickard
Pubblicazione: (2026)
Vertical Federated Graph Neural Network for Recommender System
di: Mai, Peihua, et al.
Pubblicazione: (2023)
di: Mai, Peihua, et al.
Pubblicazione: (2023)
Emergent Coordination in Multi-Agent Systems via Pressure Fields and Temporal Decay
di: Rodriguez, Roland
Pubblicazione: (2026)
di: Rodriguez, Roland
Pubblicazione: (2026)
Documenti analoghi
-
Futurity as Infrastructure: A Techno-Philosophical Interpretation of the AI Lifecycle
di: Cote, Mark, et al.
Pubblicazione: (2025) -
Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents
di: Ravindran, Santhosh Kumar
Pubblicazione: (2026) -
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems
di: Yagoubi, Faouzi El, et al.
Pubblicazione: (2026) -
From Safety Risk to Design Principle: Peer-Preservation in Multi-Agent LLM Systems and Its Implications for Orchestrated Democratic Discourse Analysis
di: Dietrich, Juergen
Pubblicazione: (2026) -
Privacy as Commodity: MFG-RegretNet for Large-Scale Privacy Trading in Federated Learning
di: Sun, Kangkang, et al.
Pubblicazione: (2026)