Detecting Safety Violations Across Many Agent Traces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Stein, Adam, Brown, Davis, Hassani, Hamed, Naik, Mayur, Wong, Eric |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Once Upon an Input: Reasoning via Per-Instance Program Synthesis
par: Stein, Adam, et autres
Publié: (2025)
par: Stein, Adam, et autres
Publié: (2025)
Adaptively profiling models with task elicitation
par: Brown, Davis, et autres
Publié: (2025)
par: Brown, Davis, et autres
Publié: (2025)
Do We Need Frontier Models to Verify Mathematical Proofs?
par: Naik, Aaditya, et autres
Publié: (2026)
par: Naik, Aaditya, et autres
Publié: (2026)
Towards Compositionality in Concept Learning
par: Stein, Adam, et autres
Publié: (2024)
par: Stein, Adam, et autres
Publié: (2024)
Evaluating the Performance of Large Language Models via Debates
par: Moniri, Behrad, et autres
Publié: (2024)
par: Moniri, Behrad, et autres
Publié: (2024)
Instruction Following by Principled Boosting Attention of Large Language Models
par: Guardieiro, Vitoria, et autres
Publié: (2025)
par: Guardieiro, Vitoria, et autres
Publié: (2025)
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
par: Anupam, Sagnik, et autres
Publié: (2025)
par: Anupam, Sagnik, et autres
Publié: (2025)
ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models
par: Li, Changyi, et autres
Publié: (2025)
par: Li, Changyi, et autres
Publié: (2025)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
par: Huang, Xinmeng, et autres
Publié: (2024)
par: Huang, Xinmeng, et autres
Publié: (2024)
Many-Tier Instruction Hierarchy in LLM Agents
par: Zhang, Jingyu, et autres
Publié: (2026)
par: Zhang, Jingyu, et autres
Publié: (2026)
Delta Activations: A Representation for Finetuned Large Language Models
par: Xu, Zhiqiu, et autres
Publié: (2025)
par: Xu, Zhiqiu, et autres
Publié: (2025)
Lobster: A GPU-Accelerated Framework for Neurosymbolic Programming
par: Biberstein, Paul, et autres
Publié: (2025)
par: Biberstein, Paul, et autres
Publié: (2025)
Governed Memory: A Production Architecture for Multi-Agent Workflows
par: Taheri, Hamed
Publié: (2026)
par: Taheri, Hamed
Publié: (2026)
Multi-Agent LLMs for Generating Research Limitations
par: Azher, Ibrahim Al, et autres
Publié: (2025)
par: Azher, Ibrahim Al, et autres
Publié: (2025)
TraceSIR: A Multi-Agent Framework for Structured Analysis and Reporting of Agentic Execution Traces
par: Yang, Shu-Xun, et autres
Publié: (2026)
par: Yang, Shu-Xun, et autres
Publié: (2026)
In Machina N400: Pinpointing Where a Causal Language Model Detects Semantic Violations
par: Zacharopoulos, Christos-Nikolaos, et autres
Publié: (2025)
par: Zacharopoulos, Christos-Nikolaos, et autres
Publié: (2025)
An Empirical Study of Many-to-Many Summarization with Large Language Models
par: Wang, Jiaan, et autres
Publié: (2025)
par: Wang, Jiaan, et autres
Publié: (2025)
Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval
par: Thakur, Nandan, et autres
Publié: (2023)
par: Thakur, Nandan, et autres
Publié: (2023)
Agent-Based Detection and Resolution of Incompleteness and Ambiguity in Interactions with Large Language Models
par: Naik, Riya, et autres
Publié: (2025)
par: Naik, Riya, et autres
Publié: (2025)
Policy-Invisible Violations in LLM-Based Agents
par: Wu, Jie, et autres
Publié: (2026)
par: Wu, Jie, et autres
Publié: (2026)
Many-Turn Jailbreaking
par: Yang, Xianjun, et autres
Publié: (2025)
par: Yang, Xianjun, et autres
Publié: (2025)
Personality Expression Across Contexts: Linguistic and Behavioral Variation in LLM Agents
par: Han, Bin, et autres
Publié: (2026)
par: Han, Bin, et autres
Publié: (2026)
It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers
par: Cho, Yong-eun
Publié: (2026)
par: Cho, Yong-eun
Publié: (2026)
Multimodal Situational Safety
par: Zhou, Kaiwen, et autres
Publié: (2024)
par: Zhou, Kaiwen, et autres
Publié: (2024)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
An AI-Based Behavioral Health Safety Filter and Dataset for Identifying Mental Health Crises in Text-Based Conversations
par: Nelson, Benjamin W., et autres
Publié: (2025)
par: Nelson, Benjamin W., et autres
Publié: (2025)
One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence
par: Li, Michelle M., et autres
Publié: (2025)
par: Li, Michelle M., et autres
Publié: (2025)
Cultural Compass: A Framework for Organizing Societal Norms to Detect Violations in Human-AI Conversations
par: Cheng, Myra, et autres
Publié: (2026)
par: Cheng, Myra, et autres
Publié: (2026)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks
par: Luo, Zhimeng, et autres
Publié: (2025)
par: Luo, Zhimeng, et autres
Publié: (2025)
CRASH: Cognitive Reasoning Agent for Safety Hazards in Autonomous Driving
par: Silva, Erick, et autres
Publié: (2026)
par: Silva, Erick, et autres
Publié: (2026)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
par: Yuan, Tongxin, et autres
Publié: (2024)
par: Yuan, Tongxin, et autres
Publié: (2024)
The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages
par: Onyame, Eric, et autres
Publié: (2026)
par: Onyame, Eric, et autres
Publié: (2026)
Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents
par: Kim, Kangsan, et autres
Publié: (2026)
par: Kim, Kangsan, et autres
Publié: (2026)
When Only the Final Text Survives: Implicit Execution Tracing for Multi-Agent Attribution
par: Nian, Yi, et autres
Publié: (2026)
par: Nian, Yi, et autres
Publié: (2026)
CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs
par: Ranjan, Ravi, et autres
Publié: (2026)
par: Ranjan, Ravi, et autres
Publié: (2026)
LettuceDetect: A Hallucination Detection Framework for RAG Applications
par: Kovács, Ádám, et autres
Publié: (2025)
par: Kovács, Ádám, et autres
Publié: (2025)
Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
par: Aghzal, Mohamed, et autres
Publié: (2026)
par: Aghzal, Mohamed, et autres
Publié: (2026)
Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems
par: Fukui, Hiroki
Publié: (2026)
par: Fukui, Hiroki
Publié: (2026)
CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
Documents similaires
-
Once Upon an Input: Reasoning via Per-Instance Program Synthesis
par: Stein, Adam, et autres
Publié: (2025) -
Adaptively profiling models with task elicitation
par: Brown, Davis, et autres
Publié: (2025) -
Do We Need Frontier Models to Verify Mathematical Proofs?
par: Naik, Aaditya, et autres
Publié: (2026) -
Towards Compositionality in Concept Learning
par: Stein, Adam, et autres
Publié: (2024) -
Evaluating the Performance of Large Language Models via Debates
par: Moniri, Behrad, et autres
Publié: (2024)