Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Yildirim, Caglar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Conversational AI as a Coding Assistant: Understanding Programmers' Interactions with and Expectations from Large Language Models for Coding
par: Akhoroz, Mehmet, et autres
Publié: (2025)
par: Akhoroz, Mehmet, et autres
Publié: (2025)
Evaluating and Understanding Scheming Propensity in LLM Agents
par: Hopman, Mia, et autres
Publié: (2026)
par: Hopman, Mia, et autres
Publié: (2026)
The Impact of Post-training on Data Contamination
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2026)
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2026)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
PsychAdapter: Adapting LLM Transformers to Reflect Traits, Personality and Mental Health
par: Vu, Huy, et autres
Publié: (2024)
par: Vu, Huy, et autres
Publié: (2024)
Training a Generally Curious Agent
par: Tajwar, Fahim, et autres
Publié: (2025)
par: Tajwar, Fahim, et autres
Publié: (2025)
Evaluating the Propensity of Generative AI for Producing Harmful Disinformation During the 2024 US Election Cycle
par: Schlicht, Erik J
Publié: (2024)
par: Schlicht, Erik J
Publié: (2024)
Systemizing Multiplicity: The Curious Case of Arbitrariness in Machine Learning
par: Ganesh, Prakhar, et autres
Publié: (2025)
par: Ganesh, Prakhar, et autres
Publié: (2025)
Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors
par: Wiedermann-Möller, Jonas, et autres
Publié: (2026)
par: Wiedermann-Möller, Jonas, et autres
Publié: (2026)
AI Chatbots for Mental Health: Values and Harms from Lived Experiences of Depression
par: Yoo, Dong Whi, et autres
Publié: (2025)
par: Yoo, Dong Whi, et autres
Publié: (2025)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs
par: Zheng, Xiang, et autres
Publié: (2026)
par: Zheng, Xiang, et autres
Publié: (2026)
VCA: Video Curious Agent for Long Video Understanding
par: Yang, Zeyuan, et autres
Publié: (2024)
par: Yang, Zeyuan, et autres
Publié: (2024)
Curious Causality-Seeking Agents Learn Meta Causal World
par: Zhao, Zhiyu, et autres
Publié: (2025)
par: Zhao, Zhiyu, et autres
Publié: (2025)
SynthAgent: A Multi-Agent LLM Framework for Realistic Patient Simulation -- A Case Study in Obesity with Mental Health Comorbidities
par: Aghaee, Arman, et autres
Publié: (2026)
par: Aghaee, Arman, et autres
Publié: (2026)
Common Sense vs. Morality: The Curious Case of Narrative Focus Bias in LLMs
par: Purkayastha, Saugata, et autres
Publié: (2026)
par: Purkayastha, Saugata, et autres
Publié: (2026)
Therapeutic AI and the Hidden Risks of Over-Disclosure: An Embedded AI-Literacy Framework for Mental Health Privacy
par: Anvari, Soraya S., et autres
Publié: (2025)
par: Anvari, Soraya S., et autres
Publié: (2025)
HARP: Measuring Harm Amplification in Multi-Agent LLM Systems
par: Rahman, Md Hafizur, et autres
Publié: (2026)
par: Rahman, Md Hafizur, et autres
Publié: (2026)
Structured Personality Control and Adaptation for LLM Agents
par: Wang, Jinpeng, et autres
Publié: (2026)
par: Wang, Jinpeng, et autres
Publié: (2026)
Propensity Inference: Environmental Contributors to LLM Behaviour
par: Järviniemi, Olli, et autres
Publié: (2026)
par: Järviniemi, Olli, et autres
Publié: (2026)
An Agentic LLM-Based Framework for Population-Scale Mental Health Screening
par: Lorenzoni, Giuliano, et autres
Publié: (2026)
par: Lorenzoni, Giuliano, et autres
Publié: (2026)
Spiritual-LLM : Gita Inspired Mental Health Therapy In the Era of LLMs
par: Kapuriya, Janak, et autres
Publié: (2025)
par: Kapuriya, Janak, et autres
Publié: (2025)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
par: Yang, Langqi, et autres
Publié: (2025)
par: Yang, Langqi, et autres
Publié: (2025)
Self-HarmLLM: Can Large Language Model Harm Itself?
par: Kim, Heehwan, et autres
Publié: (2025)
par: Kim, Heehwan, et autres
Publié: (2025)
LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health
par: Tian, Ye, et autres
Publié: (2026)
par: Tian, Ye, et autres
Publié: (2026)
PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents
par: Wu, Yaozu, et autres
Publié: (2025)
par: Wu, Yaozu, et autres
Publié: (2025)
The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
par: Islam, Saad Obaid ul, et autres
Publié: (2025)
Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems
par: Karnam, Meghana, et autres
Publié: (2026)
par: Karnam, Meghana, et autres
Publié: (2026)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
par: Jiang, Yukun, et autres
Publié: (2026)
par: Jiang, Yukun, et autres
Publié: (2026)
OnRL-RAG: Real-Time Personalized Mental Health Dialogue System
par: Bilal, Ahsan, et autres
Publié: (2025)
par: Bilal, Ahsan, et autres
Publié: (2025)
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate
par: Zhu, Shenzhe
Publié: (2025)
par: Zhu, Shenzhe
Publié: (2025)
A Curious Case of Remarkable Resilience to Gradient Attacks via Fully Convolutional and Differentiable Front End with a Skip Connection
par: Boytsov, Leonid, et autres
Publié: (2024)
par: Boytsov, Leonid, et autres
Publié: (2024)
SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests
par: Pandey, Punya Syon, et autres
Publié: (2025)
par: Pandey, Punya Syon, et autres
Publié: (2025)
Echoes of AI Harms: A Human-LLM Synergistic Framework for Bias-Driven Harm Anticipation
par: Tantalaki, Nicoleta, et autres
Publié: (2025)
par: Tantalaki, Nicoleta, et autres
Publié: (2025)
Evaluating the Utility of Personal Health Records in Personalized Health AI
par: Sayres, Rory, et autres
Publié: (2026)
par: Sayres, Rory, et autres
Publié: (2026)
Beyond Dialogue Time: Temporal Semantic Memory for Personalized LLM Agents
par: Su, Miao, et autres
Publié: (2026)
par: Su, Miao, et autres
Publié: (2026)
Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions
par: Xu, Yue, et autres
Publié: (2026)
par: Xu, Yue, et autres
Publié: (2026)
Structured Personalization: Modeling Constraints as Matroids for Data-Minimal LLM Agents
par: Platnick, Daniel, et autres
Publié: (2025)
par: Platnick, Daniel, et autres
Publié: (2025)
LLM-X: A Scalable Negotiation-Oriented Exchange for Communication Among Personal LLM Agents
par: Lorenzoni, Giuliano, et autres
Publié: (2026)
par: Lorenzoni, Giuliano, et autres
Publié: (2026)
Documents similaires
-
Conversational AI as a Coding Assistant: Understanding Programmers' Interactions with and Expectations from Large Language Models for Coding
par: Akhoroz, Mehmet, et autres
Publié: (2025) -
Evaluating and Understanding Scheming Propensity in LLM Agents
par: Hopman, Mia, et autres
Publié: (2026) -
The Impact of Post-training on Data Contamination
par: Kocyigit, Muhammed Yusuf, et autres
Publié: (2026) -
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
par: Andriushchenko, Maksym, et autres
Publié: (2024) -
PsychAdapter: Adapting LLM Transformers to Reflect Traits, Personality and Mental Health
par: Vu, Huy, et autres
Publié: (2024)