Auditing Agent Harness Safety
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Chengzhi, Guo, Yichen, Liu, Yepeng, Yang, Yuzhe, Yan, Qianqi, Zhao, Xuandong, Hua, Wenyue, Liu, Sheng, Li, Sharon, Bu, Yuheng, Wang, Xin Eric |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
In-Context Watermarks for Large Language Models
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
Adaptive Text Watermark for Large Language Models
por: Liu, Yepeng, et al.
Publicado: (2024)
por: Liu, Yepeng, et al.
Publicado: (2024)
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
por: Liu, Chengzhi, et al.
Publicado: (2026)
por: Liu, Chengzhi, et al.
Publicado: (2026)
Multimodal Situational Safety
por: Zhou, Kaiwen, et al.
Publicado: (2024)
por: Zhou, Kaiwen, et al.
Publicado: (2024)
The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1
por: Zhou, Kaiwen, et al.
Publicado: (2025)
por: Zhou, Kaiwen, et al.
Publicado: (2025)
Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset
por: Chehbouni, Khaoula, et al.
Publicado: (2024)
por: Chehbouni, Khaoula, et al.
Publicado: (2024)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
War and Peace (WarAgent): Large Language Model-based Multi-Agent Simulation of World Wars
por: Hua, Wenyue, et al.
Publicado: (2023)
por: Hua, Wenyue, et al.
Publicado: (2023)
The Silicon Ceiling: Auditing GPT's Race and Gender Biases in Hiring
por: Armstrong, Lena, et al.
Publicado: (2024)
por: Armstrong, Lena, et al.
Publicado: (2024)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
por: An, Li, et al.
Publicado: (2025)
por: An, Li, et al.
Publicado: (2025)
Exploring Novelty Differences between Industry and Academia: A Knowledge Entity-centric Perspective
por: Zhao, Hongye, et al.
Publicado: (2026)
por: Zhao, Hongye, et al.
Publicado: (2026)
A Multimodal, Multilingual, and Multidimensional Pipeline for Fine-grained Crowdsourcing Earthquake Damage Evaluation
por: Ma, Zihui, et al.
Publicado: (2025)
por: Ma, Zihui, et al.
Publicado: (2025)
The Better Angels of Machine Personality: How Personality Relates to LLM Safety
por: Zhang, Jie, et al.
Publicado: (2024)
por: Zhang, Jie, et al.
Publicado: (2024)
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Assessing Judging Bias in Large Reasoning Models: An Empirical Study
por: Wang, Qian, et al.
Publicado: (2025)
por: Wang, Qian, et al.
Publicado: (2025)
Analyzing the Safety of Japanese Large Language Models in Stereotype-Triggering Prompts
por: Nakanishi, Akito, et al.
Publicado: (2025)
por: Nakanishi, Akito, et al.
Publicado: (2025)
From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization
por: Yan, Qianqi, et al.
Publicado: (2026)
por: Yan, Qianqi, et al.
Publicado: (2026)
Auditing Stance Asymmetry in Generative Explanations
por: Han, Jiarui
Publicado: (2026)
por: Han, Jiarui
Publicado: (2026)
Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
AuditWen:An Open-Source Large Language Model for Audit
por: Huang, Jiajia, et al.
Publicado: (2024)
por: Huang, Jiajia, et al.
Publicado: (2024)
Exploring Gender Biases in Language Patterns of Human-Conversational Agent Conversations
por: Liu, Weizi
Publicado: (2024)
por: Liu, Weizi
Publicado: (2024)
Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations
por: Gomaa, Amr, et al.
Publicado: (2025)
por: Gomaa, Amr, et al.
Publicado: (2025)
EmpathyAgent: Can Embodied Agents Conduct Empathetic Actions?
por: Chen, Xinyan, et al.
Publicado: (2025)
por: Chen, Xinyan, et al.
Publicado: (2025)
REALM: A Dataset of Real-World LLM Use Cases
por: Cheng, Jingwen, et al.
Publicado: (2025)
por: Cheng, Jingwen, et al.
Publicado: (2025)
Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PD
por: Tan, Bryan Chen Zhengyu, et al.
Publicado: (2025)
por: Tan, Bryan Chen Zhengyu, et al.
Publicado: (2025)
Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts
por: Zhang, Wenjing, et al.
Publicado: (2025)
por: Zhang, Wenjing, et al.
Publicado: (2025)
Characterizing Selective Refusal Bias in Large Language Models
por: Khorramrouz, Adel, et al.
Publicado: (2025)
por: Khorramrouz, Adel, et al.
Publicado: (2025)
EcoLANG: Efficient and Effective Agent Communication Language Induction for Social Simulation
por: Mou, Xinyi, et al.
Publicado: (2025)
por: Mou, Xinyi, et al.
Publicado: (2025)
AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive Scenarios
por: Mou, Xinyi, et al.
Publicado: (2024)
por: Mou, Xinyi, et al.
Publicado: (2024)
A Comparative Evaluation of Structural Topic Models and BERTopic for Short, Open-Ended Survey Responses
por: Jiang, Yan, et al.
Publicado: (2026)
por: Jiang, Yan, et al.
Publicado: (2026)
Audit Me If You Can: Query-Efficient Active Fairness Auditing of Black-Box LLMs
por: Hartmann, David, et al.
Publicado: (2026)
por: Hartmann, David, et al.
Publicado: (2026)
The Staircase of Ethics: Probing LLM Value Priorities through Multi-Step Induction to Complex Moral Dilemmas
por: Wu, Ya, et al.
Publicado: (2025)
por: Wu, Ya, et al.
Publicado: (2025)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
por: Yan, Qianqi, et al.
Publicado: (2026)
por: Yan, Qianqi, et al.
Publicado: (2026)
SOTOPIA-$Ω$: Dynamic Strategy Injection Learning and Social Instruction Following Evaluation for Social Agents
por: Zhang, Wenyuan, et al.
Publicado: (2025)
por: Zhang, Wenyuan, et al.
Publicado: (2025)
On the Suitability of LLM-Driven Agents for Dark Pattern Audits
por: Sun, Chen, et al.
Publicado: (2026)
por: Sun, Chen, et al.
Publicado: (2026)
Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of Race
por: Sun, Lihao, et al.
Publicado: (2025)
por: Sun, Lihao, et al.
Publicado: (2025)
How Did We Get Here? Summarizing Conversation Dynamics
por: Hua, Yilun, et al.
Publicado: (2024)
por: Hua, Yilun, et al.
Publicado: (2024)
Ejemplares similares
-
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
por: Liu, Yepeng, et al.
Publicado: (2025) -
In-Context Watermarks for Large Language Models
por: Liu, Yepeng, et al.
Publicado: (2025) -
Adaptive Text Watermark for Large Language Models
por: Liu, Yepeng, et al.
Publicado: (2024) -
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
por: Liu, Yepeng, et al.
Publicado: (2025) -
WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
por: Liu, Chengzhi, et al.
Publicado: (2026)