Enregistré dans:
| Auteurs principaux: | Turtayev, Rustem, Fedorova, Natalia, Serikov, Oleg, Koldyba, Sergey, Avagyan, Lev, Volkov, Dmitrii |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.19738 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hacking CTFs with Plain Agents
par: Turtayev, Rustem, et autres
Publié: (2024)
par: Turtayev, Rustem, et autres
Publié: (2024)
LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild
par: Reworr, et autres
Publié: (2024)
par: Reworr, et autres
Publié: (2024)
Evaluating AI cyber capabilities with crowdsourced elicitation
par: Petrov, Artem, et autres
Publié: (2025)
par: Petrov, Artem, et autres
Publié: (2025)
Hodoscope: Unsupervised Monitoring for AI Misbehaviors
par: Zhong, Ziqian, et autres
Publié: (2026)
par: Zhong, Ziqian, et autres
Publié: (2026)
Training Agents to Self-Report Misbehavior
par: Lee, Bruce W., et autres
Publié: (2026)
par: Lee, Bruce W., et autres
Publié: (2026)
Badllama 3: removing safety finetuning from Llama 3 in minutes
par: Volkov, Dmitrii
Publié: (2024)
par: Volkov, Dmitrii
Publié: (2024)
Wink: Recovering from Misbehaviors in Coding Agents
par: Nanda, Rahul, et autres
Publié: (2026)
par: Nanda, Rahul, et autres
Publié: (2026)
How to Correctly do Semantic Backpropagation on Language-based Agentic Systems
par: Wang, Wenyi, et autres
Publié: (2024)
par: Wang, Wenyi, et autres
Publié: (2024)
Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation
par: Baker, Bowen, et autres
Publié: (2025)
par: Baker, Bowen, et autres
Publié: (2025)
Demonstrating specification gaming in reasoning models
par: Bondarenko, Alexander, et autres
Publié: (2025)
par: Bondarenko, Alexander, et autres
Publié: (2025)
Agent Hunt: Bounty Based Collaborative Autoformalization With LLM Agents
par: Brown, Chad E., et autres
Publié: (2026)
par: Brown, Chad E., et autres
Publié: (2026)
LLMScan: Causal Scan for LLM Misbehavior Detection
par: Zhang, Mengdi, et autres
Publié: (2024)
par: Zhang, Mengdi, et autres
Publié: (2024)
Multi-layer random features and the approximation power of neural networks
par: Takhanov, Rustem
Publié: (2024)
par: Takhanov, Rustem
Publié: (2024)
The Current State of AI Bias Bounties: An Overview of Existing Programmes and Research
par: Kucenko, Sergej, et autres
Publié: (2025)
par: Kucenko, Sergej, et autres
Publié: (2025)
BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems
par: Zhang, Andy K., et autres
Publié: (2025)
par: Zhang, Andy K., et autres
Publié: (2025)
TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality
par: Liu, Zidong, et autres
Publié: (2026)
par: Liu, Zidong, et autres
Publié: (2026)
From Single Agent to Multi-Agent: Improving Traffic Signal Control
par: Tislenko, Maksim, et autres
Publié: (2024)
par: Tislenko, Maksim, et autres
Publié: (2024)
Convergence dynamics of Agent-to-Agent Interactions with Misaligned objectives
par: Cosentino, Romain, et autres
Publié: (2025)
par: Cosentino, Romain, et autres
Publié: (2025)
Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models
par: Min, Nay Myat, et autres
Publié: (2026)
par: Min, Nay Myat, et autres
Publié: (2026)
A Novel Labeled Human Voice Signal Dataset for Misbehavior Detection
par: Raza, Ali, et autres
Publié: (2024)
par: Raza, Ali, et autres
Publié: (2024)
Conditional KRR: Injecting Unpenalized Features into Kernel Methods with Applications to Kernel Thresholding
par: Takhanov, Rustem, et autres
Publié: (2026)
par: Takhanov, Rustem, et autres
Publié: (2026)
Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning
par: Dvirniak, Artem, et autres
Publié: (2026)
par: Dvirniak, Artem, et autres
Publié: (2026)
AttentionGuard: Transformer-based Misbehavior Detection for Secure Vehicular Platoons
par: Li, Hexu, et autres
Publié: (2025)
par: Li, Hexu, et autres
Publié: (2025)
The Coming Crisis of Multi-Agent Misalignment: AI Alignment Must Be a Dynamic and Social Process
par: Carichon, Florian, et autres
Publié: (2025)
par: Carichon, Florian, et autres
Publié: (2025)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
par: Fang, Haishuo, et autres
Publié: (2024)
par: Fang, Haishuo, et autres
Publié: (2024)
Assessing the Potential of Generative Agents in Crowdsourced Fact-Checking
par: Costabile, Luigia, et autres
Publié: (2025)
par: Costabile, Luigia, et autres
Publié: (2025)
Attention in Motion: Secure Platooning via Transformer-based Misbehavior Detection
par: Kalogiannis, Konstantinos, et autres
Publié: (2025)
par: Kalogiannis, Konstantinos, et autres
Publié: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026)
par: Soligo, Anna, et autres
Publié: (2026)
Semantic Laundering in AI Agent Architectures: Why Tool Boundaries Do Not Confer Epistemic Warrant
par: Romanchuk, Oleg, et autres
Publié: (2026)
par: Romanchuk, Oleg, et autres
Publié: (2026)
Probabilistic Verification of Voice Anti-Spoofing Models
par: Kushnir, Evgeny, et autres
Publié: (2026)
par: Kushnir, Evgeny, et autres
Publié: (2026)
Experimental Narratives: A Comparison of Human Crowdsourced Storytelling and AI Storytelling
par: Begus, Nina
Publié: (2023)
par: Begus, Nina
Publié: (2023)
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
par: Hu, Xuhao, et autres
Publié: (2025)
par: Hu, Xuhao, et autres
Publié: (2025)
Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment
par: Carro, Maria Victoria, et autres
Publié: (2026)
par: Carro, Maria Victoria, et autres
Publié: (2026)
Overtrained, Not Misaligned
par: Schreiber, Joel, et autres
Publié: (2026)
par: Schreiber, Joel, et autres
Publié: (2026)
Human-in-the-Loop and AI: Crowdsourcing Metadata Vocabulary for Materials Science
par: Greenberg, Jane, et autres
Publié: (2025)
par: Greenberg, Jane, et autres
Publié: (2025)
ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use
par: Tien, Jeremy, et autres
Publié: (2026)
par: Tien, Jeremy, et autres
Publié: (2026)
The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?
par: Hägele, Alexander, et autres
Publié: (2026)
par: Hägele, Alexander, et autres
Publié: (2026)
Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems
par: Weckbecker, Moritz, et autres
Publié: (2026)
par: Weckbecker, Moritz, et autres
Publié: (2026)
Password-Activated Shutdown Protocols for Misaligned Frontier Agents
par: Williams, Kai, et autres
Publié: (2025)
par: Williams, Kai, et autres
Publié: (2025)
AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents
par: Naik, Akshat, et autres
Publié: (2025)
par: Naik, Akshat, et autres
Publié: (2025)
Documents similaires
-
Hacking CTFs with Plain Agents
par: Turtayev, Rustem, et autres
Publié: (2024) -
LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild
par: Reworr, et autres
Publié: (2024) -
Evaluating AI cyber capabilities with crowdsourced elicitation
par: Petrov, Artem, et autres
Publié: (2025) -
Hodoscope: Unsupervised Monitoring for AI Misbehaviors
par: Zhong, Ziqian, et autres
Publié: (2026) -
Training Agents to Self-Report Misbehavior
par: Lee, Bruce W., et autres
Publié: (2026)