Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Qingyang, Shen, Yaling, Fong, Stephanie, Wang, Zimu, Jiang, Yiwen, Zhao, Xiangyu, Liu, Jiahe, Xu, Zhongxing, Lee, Vincent, Ge, Zongyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
di: Shen, Yaling, et al.
Pubblicazione: (2026)
di: Shen, Yaling, et al.
Pubblicazione: (2026)
WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification
di: Jiang, Yiwen, et al.
Pubblicazione: (2025)
di: Jiang, Yiwen, et al.
Pubblicazione: (2025)
It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
CHiRPE: A Step Towards Real-World Clinical NLP with Clinician-Oriented Model Explanations
di: Fong, Stephanie, et al.
Pubblicazione: (2026)
di: Fong, Stephanie, et al.
Pubblicazione: (2026)
CARE-Bench: A Benchmark of Diverse Client Simulations Guided by Expert Principles for Evaluating LLMs in Psychological Counseling
di: Wang, Bichen, et al.
Pubblicazione: (2025)
di: Wang, Bichen, et al.
Pubblicazione: (2025)
PsyDT: Using LLMs to Construct the Digital Twin of Psychological Counselor with Personalized Counseling Style for Psychological Counseling
di: Xie, Haojie, et al.
Pubblicazione: (2024)
di: Xie, Haojie, et al.
Pubblicazione: (2024)
Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs
di: Mandal, Aishik, et al.
Pubblicazione: (2026)
di: Mandal, Aishik, et al.
Pubblicazione: (2026)
Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic Segmentation
di: Tang, Feilong, et al.
Pubblicazione: (2024)
di: Tang, Feilong, et al.
Pubblicazione: (2024)
Consistent Client Simulation for Motivational Interviewing-based Counseling
di: Yang, Yizhe, et al.
Pubblicazione: (2025)
di: Yang, Yizhe, et al.
Pubblicazione: (2025)
Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP
di: Xu, Zhongxing, et al.
Pubblicazione: (2024)
di: Xu, Zhongxing, et al.
Pubblicazione: (2024)
Simulating Misinformation Vulnerabilities With Agent Personas
di: Farr, David, et al.
Pubblicazione: (2025)
di: Farr, David, et al.
Pubblicazione: (2025)
Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models
di: Yang, Yijun, et al.
Pubblicazione: (2025)
di: Yang, Yijun, et al.
Pubblicazione: (2025)
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
di: Struppek, Lukas, et al.
Pubblicazione: (2026)
di: Struppek, Lukas, et al.
Pubblicazione: (2026)
Exposing the Illusion of Fairness: Auditing Vulnerabilities to Distributional Manipulation Attacks
di: Lafargue, Valentin, et al.
Pubblicazione: (2025)
di: Lafargue, Valentin, et al.
Pubblicazione: (2025)
The Hidden Language of Harm: Examining the Role of Emojis in Harmful Online Communication and Content Moderation
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
Spiritual Psychology and Counseling
Pubblicazione: (2016)
Pubblicazione: (2016)
Enhancing Interpretable Image Classification Through LLM Agents and Conditional Concept Bottleneck Models
di: Jiang, Yiwen, et al.
Pubblicazione: (2025)
di: Jiang, Yiwen, et al.
Pubblicazione: (2025)
Presearch Counseling for Client Searchers (End-Users).
di: Janke, Richard V.
Pubblicazione: (1985)
di: Janke, Richard V.
Pubblicazione: (1985)
Do Artificial Intelligence Clients Speak Like Human Clients? Exploring GPT‐4's Content‐Level Performance in Counseling Role‐Play
di: Xihe Tian, et al.
Pubblicazione: (2025)
di: Xihe Tian, et al.
Pubblicazione: (2025)
Exploring ChatGPT's Capabilities, Stability, Potential and Risks in Conducting Psychological Counseling through Simulations in School Counseling
di: Ni, Yang, et al.
Pubblicazione: (2025)
di: Ni, Yang, et al.
Pubblicazione: (2025)
Federated Learning Under Attack: Exposing Vulnerabilities through Data Poisoning Attacks in Computer Networks
di: Nowroozi, Ehsan, et al.
Pubblicazione: (2024)
di: Nowroozi, Ehsan, et al.
Pubblicazione: (2024)
An LLM-based Simulation Framework for Embodied Conversational Agents in Psychological Counseling
di: Wu, Lixiu, et al.
Pubblicazione: (2024)
di: Wu, Lixiu, et al.
Pubblicazione: (2024)
Academic Journal of Psychology and Counseling
Pubblicazione: (2022)
Pubblicazione: (2022)
Bullying the Machine: How Personas Increase LLM Vulnerability
di: Xu, Ziwei, et al.
Pubblicazione: (2025)
di: Xu, Ziwei, et al.
Pubblicazione: (2025)
Psychological Counseling Cannot Be Achieved Overnight: Automated Psychological Counseling Through Multi-Session Conversations
di: Wang, Junzhe, et al.
Pubblicazione: (2025)
di: Wang, Junzhe, et al.
Pubblicazione: (2025)
Understanding the Therapeutic Relationship between Counselors and Clients in Online Text-based Counseling using LLMs
di: Li, Anqi, et al.
Pubblicazione: (2024)
di: Li, Anqi, et al.
Pubblicazione: (2024)
Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights
di: Choi, Sooyung, et al.
Pubblicazione: (2025)
di: Choi, Sooyung, et al.
Pubblicazione: (2025)
Exposing Vulnerabilities in Explanation for Time Series Classifiers via Dual-Target Attacks
di: Wang, Bohan, et al.
Pubblicazione: (2026)
di: Wang, Bohan, et al.
Pubblicazione: (2026)
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
di: Li, Xueyi, et al.
Pubblicazione: (2026)
di: Li, Xueyi, et al.
Pubblicazione: (2026)
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
di: Xiong, Yuan, et al.
Pubblicazione: (2025)
di: Xiong, Yuan, et al.
Pubblicazione: (2025)
Born Substance Exposed, Educationally Vulnerable. Exceptional Children at Risk: CEC Mini-Library.
di: Vincent, Lisbeth J., et al.
Pubblicazione: (1991)
di: Vincent, Lisbeth J., et al.
Pubblicazione: (1991)
Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
di: Dai, Chongyuan, et al.
Pubblicazione: (2026)
di: Dai, Chongyuan, et al.
Pubblicazione: (2026)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
di: Bianchi, Federico, et al.
Pubblicazione: (2024)
di: Bianchi, Federico, et al.
Pubblicazione: (2024)
Multi-dimensional Assessment and Explainable Feedback for Counselor Responses to Client Resistance in Text-based Counseling with LLMs
di: Li, Anqi, et al.
Pubblicazione: (2026)
di: Li, Anqi, et al.
Pubblicazione: (2026)
How Do Consumers Really Choose: Exposing Hidden Preferences with the Mixture of Experts Model
di: Vallarino, Diego
Pubblicazione: (2025)
di: Vallarino, Diego
Pubblicazione: (2025)
Journal for Social Action in Counseling and Psychology
Pubblicazione: (2025)
Pubblicazione: (2025)
Psychology and Counseling Library Research Guide.
di: Sylvia, Margaret
Pubblicazione: (1995)
di: Sylvia, Margaret
Pubblicazione: (1995)
Exposing Vulnerabilities in RL: A Novel Stealthy Backdoor Attack through Reward Poisoning
di: Zhang, Bokang, et al.
Pubblicazione: (2025)
di: Zhang, Bokang, et al.
Pubblicazione: (2025)
Audio Jailbreak Attacks: Exposing Vulnerabilities in SpeechGPT in a White-Box Framework
di: Ma, Binhao, et al.
Pubblicazione: (2025)
di: Ma, Binhao, et al.
Pubblicazione: (2025)
Exposing the Vulnerability of Decentralized Learning to Membership Inference Attacks Through the Lens of Graph Mixing
di: Touat, Ousmane, et al.
Pubblicazione: (2024)
di: Touat, Ousmane, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
di: Shen, Yaling, et al.
Pubblicazione: (2026) -
WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification
di: Jiang, Yiwen, et al.
Pubblicazione: (2025) -
It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025) -
CHiRPE: A Step Towards Real-World Clinical NLP with Clinician-Oriented Model Explanations
di: Fong, Stephanie, et al.
Pubblicazione: (2026) -
CARE-Bench: A Benchmark of Diverse Client Simulations Guided by Expert Principles for Evaluating LLMs in Psychological Counseling
di: Wang, Bichen, et al.
Pubblicazione: (2025)