Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dang, Jacob, Xie, Brian Y., Younis, Omar G. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Subliminal Learning Is Steering Vector Distillation
par: Blank, Camila, et autres
Publié: (2026)
par: Blank, Camila, et autres
Publié: (2026)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
par: Schrodi, Simon, et autres
Publié: (2025)
par: Schrodi, Simon, et autres
Publié: (2025)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
par: Askin, Baris, et autres
Publié: (2026)
par: Askin, Baris, et autres
Publié: (2026)
ClawSafety: "Safe" LLMs, Unsafe Agents
par: Wei, Bowen, et autres
Publié: (2026)
par: Wei, Bowen, et autres
Publié: (2026)
Enforcing Benign Trajectories: A Behavioral Firewall for Structured-Workflow AI Agents
par: Dang, Hung
Publié: (2026)
par: Dang, Hung
Publié: (2026)
Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems
par: Weckbecker, Moritz, et autres
Publié: (2026)
par: Weckbecker, Moritz, et autres
Publié: (2026)
Subliminal Learning is a LoRA Artifact
par: Nief, Todd, et autres
Publié: (2026)
par: Nief, Todd, et autres
Publié: (2026)
Subliminal Learning: Language models transmit behavioral traits via hidden signals in data
par: Cloud, Alex, et autres
Publié: (2025)
par: Cloud, Alex, et autres
Publié: (2025)
History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions
par: Salgado, Alberto G. Rodríguez
Publié: (2026)
par: Salgado, Alberto G. Rodríguez
Publié: (2026)
When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
par: Jones, Jaylen, et autres
Publié: (2026)
par: Jones, Jaylen, et autres
Publié: (2026)
Sustained Gradient Alignment Mediates Subliminal Learning in a Multi-Step Setting: Evidence from MNIST Auxiliary Logit Distillation Experiment
par: Kitkana, Chayanon, et autres
Publié: (2026)
par: Kitkana, Chayanon, et autres
Publié: (2026)
Behavioral Determinants of Deployed AI Agents in Social Networks: A Multi-Factor Study of Personality, Model, and Guardrail Specification
par: Wilson, Sarah, et autres
Publié: (2026)
par: Wilson, Sarah, et autres
Publié: (2026)
Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills
par: Ni, Jingwei, et autres
Publié: (2026)
par: Ni, Jingwei, et autres
Publié: (2026)
Behavioral Transfer in AI Agents: Evidence and Privacy Implications
par: Luo, Shilei, et autres
Publié: (2026)
par: Luo, Shilei, et autres
Publié: (2026)
Subliminal Effects in Your Data: A General Mechanism via Log-Linearity
par: Aden-Ali, Ishaq, et autres
Publié: (2026)
par: Aden-Ali, Ishaq, et autres
Publié: (2026)
Breach By A Thousand Leaks: Unsafe Information Leakage in `Safe' AI Responses
par: Glukhov, David, et autres
Publié: (2024)
par: Glukhov, David, et autres
Publié: (2024)
Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search
par: Neary, Cyrus, et autres
Publié: (2025)
par: Neary, Cyrus, et autres
Publié: (2025)
Advancing Model Refinement: Muon-Optimized Distillation and Quantization for LLM Deployment
par: Sander, Jacob, et autres
Publié: (2026)
par: Sander, Jacob, et autres
Publié: (2026)
PANDO: Efficient Multimodal AI Agents via Online Skill Distillation
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes
par: Qiu, Jiahao, et autres
Publié: (2025)
par: Qiu, Jiahao, et autres
Publié: (2025)
Learning Through Noise: Why Subliminal Learning Works and When It Fails
par: Brockers, Vincent C., et autres
Publié: (2026)
par: Brockers, Vincent C., et autres
Publié: (2026)
The Agent Behavior: Model, Governance and Challenges in the AI Digital Age
par: Zhang, Qiang, et autres
Publié: (2025)
par: Zhang, Qiang, et autres
Publié: (2025)
Bidirectional Distillation: A Mixed-Play Framework for Multi-Agent Generalizable Behaviors
par: Feng, Lang, et autres
Publié: (2025)
par: Feng, Lang, et autres
Publié: (2025)
ELISA: An Interpretable Hybrid Generative AI Agent for Expression-Grounded Discovery in Single-Cell Genomics
par: Coser, Omar
Publié: (2026)
par: Coser, Omar
Publié: (2026)
Offline Behavior Distillation
par: Lei, Shiye, et autres
Publié: (2024)
par: Lei, Shiye, et autres
Publié: (2024)
Unsafe LLM-Based Search: Quantitative Analysis and Mitigation of Safety Risks in AI Web Search
par: Luo, Zeren, et autres
Publié: (2025)
par: Luo, Zeren, et autres
Publié: (2025)
Safe-Support Q-Learning: Learning without Unsafe Exploration
par: Lim, Yeeun, et autres
Publié: (2026)
par: Lim, Yeeun, et autres
Publié: (2026)
Promoting Online Safety by Simulating Unsafe Conversations with LLMs
par: Hoffman, Owen, et autres
Publié: (2025)
par: Hoffman, Owen, et autres
Publié: (2025)
AIBuildAI: An AI Agent for Automatically Building AI Models
par: Zhang, Ruiyi, et autres
Publié: (2026)
par: Zhang, Ruiyi, et autres
Publié: (2026)
Predicting AI Agent Behavior through Approximation of the Perron-Frobenius Operator
par: Zhang, Shiqi, et autres
Publié: (2024)
par: Zhang, Shiqi, et autres
Publié: (2024)
Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents
par: Dang, Hy, et autres
Publié: (2026)
par: Dang, Hy, et autres
Publié: (2026)
Transferable XAI: Relating Understanding Across Domains with Explanation Transfer
par: Wang, Fei, et autres
Publié: (2026)
par: Wang, Fei, et autres
Publié: (2026)
Forage V2: Knowledge Evolution and Transfer in Autonomous Agent Organizations
par: Xie, Huaqing
Publié: (2026)
par: Xie, Huaqing
Publié: (2026)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
par: Cai, Wei, et autres
Publié: (2025)
par: Cai, Wei, et autres
Publié: (2025)
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
Data-Free Generative Replay for Class-Incremental Learning on Imbalanced Data
par: Younis, Sohaib, et autres
Publié: (2024)
par: Younis, Sohaib, et autres
Publié: (2024)
Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
par: Zhang, Dongcheng, et autres
Publié: (2026)
par: Zhang, Dongcheng, et autres
Publié: (2026)
Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models
par: Yang, Jingyuan, et autres
Publié: (2025)
par: Yang, Jingyuan, et autres
Publié: (2025)
Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
par: Qu, Yiting, et autres
Publié: (2025)
par: Qu, Yiting, et autres
Publié: (2025)
Exploration Behavior of Untrained Policies
par: Adamczyk, Jacob
Publié: (2025)
par: Adamczyk, Jacob
Publié: (2025)
Documents similaires
-
Subliminal Learning Is Steering Vector Distillation
par: Blank, Camila, et autres
Publié: (2026) -
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
par: Schrodi, Simon, et autres
Publié: (2025) -
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
par: Askin, Baris, et autres
Publié: (2026) -
ClawSafety: "Safe" LLMs, Unsafe Agents
par: Wei, Bowen, et autres
Publié: (2026) -
Enforcing Benign Trajectories: A Behavioral Firewall for Structured-Workflow AI Agents
par: Dang, Hung
Publié: (2026)