PediatricAnxietyBench: Evaluating Large Language Model Safety Under Parental Anxiety and Pressure in Pediatric Consultations
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Zolfaghari, Vahideh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox
par: Zolfaghari, Vahideh
Publié: (2025)
par: Zolfaghari, Vahideh
Publié: (2025)
When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception
par: Zolfaghari, Vahideh
Publié: (2026)
par: Zolfaghari, Vahideh
Publié: (2026)
RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation
par: Zhao, Jiahao, et autres
Publié: (2025)
par: Zhao, Jiahao, et autres
Publié: (2025)
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
par: Han, Tessa, et autres
Publié: (2024)
par: Han, Tessa, et autres
Publié: (2024)
Performance Evaluation of Lightweight Open-source Large Language Models in Pediatric Consultations: A Comparative Analysis
par: Wei, Qiuhong, et autres
Publié: (2024)
par: Wei, Qiuhong, et autres
Publié: (2024)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
par: Xie, Tinghao, et autres
Publié: (2024)
par: Xie, Tinghao, et autres
Publié: (2024)
A Data-Centric Approach to Detecting and Mitigating Demographic Bias in Pediatric Mental Health Text: A Case Study in Anxiety Detection
par: Ive, Julia, et autres
Publié: (2024)
par: Ive, Julia, et autres
Publié: (2024)
BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
par: Taheri, Ali, et autres
Publié: (2025)
par: Taheri, Ali, et autres
Publié: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
par: Zong, Xuanjun, et autres
Publié: (2025)
par: Zong, Xuanjun, et autres
Publié: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
par: Liu, Zheyuan, et autres
Publié: (2026)
par: Liu, Zheyuan, et autres
Publié: (2026)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
par: Zhang, Wenjing, et autres
Publié: (2024)
par: Zhang, Wenjing, et autres
Publié: (2024)
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
par: Li, Lingyu, et autres
Publié: (2024)
par: Li, Lingyu, et autres
Publié: (2024)
SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models
par: Abdelnasser, Omar, et autres
Publié: (2026)
par: Abdelnasser, Omar, et autres
Publié: (2026)
BuddyBench: A Privacy-Constrained Multi-Task Benchmark for Pediatric Social-Communication Personalization
par: Eo, Jeyeon, et autres
Publié: (2026)
par: Eo, Jeyeon, et autres
Publié: (2026)
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
par: Sehwag, Udari Madhushani, et autres
Publié: (2025)
par: Sehwag, Udari Madhushani, et autres
Publié: (2025)
Evaluating the Safety and Skill Reasoning of Large Reasoning Models Under Compute Constraints
par: Balaji, Adarsha, et autres
Publié: (2025)
par: Balaji, Adarsha, et autres
Publié: (2025)
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
Optimizing Large Language Models for Detecting Symptoms of Comorbid Depression or Anxiety in Chronic Diseases: Insights from Patient Messages
par: Kim, Jiyeong, et autres
Publié: (2025)
par: Kim, Jiyeong, et autres
Publié: (2025)
Voice Biomarkers for Depression and Anxiety
par: Abramenko, Oleksii, et autres
Publié: (2026)
par: Abramenko, Oleksii, et autres
Publié: (2026)
From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data
par: Kursuncu, Ugur, et autres
Publié: (2025)
par: Kursuncu, Ugur, et autres
Publié: (2025)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
par: Qiao, Chuhan, et autres
Publié: (2026)
par: Qiao, Chuhan, et autres
Publié: (2026)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
par: Liu, Junyu, et autres
Publié: (2026)
par: Liu, Junyu, et autres
Publié: (2026)
Contextual Phenotyping of Pediatric Sepsis Cohort Using Large Language Models
par: Nagori, Aditya, et autres
Publié: (2025)
par: Nagori, Aditya, et autres
Publié: (2025)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
par: Sabour, Sahand, et autres
Publié: (2024)
par: Sabour, Sahand, et autres
Publié: (2024)
CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms
par: Bugaud, Zacharie
Publié: (2026)
par: Bugaud, Zacharie
Publié: (2026)
ElecBench: a Power Dispatch Evaluation Benchmark for Large Language Models
par: Zhou, Xiyuan, et autres
Publié: (2024)
par: Zhou, Xiyuan, et autres
Publié: (2024)
SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models
par: Monti, Sebastiano, et autres
Publié: (2026)
par: Monti, Sebastiano, et autres
Publié: (2026)
Knowledge-Guided Large Language Model for Automatic Pediatric Dental Record Understanding and Safe Antibiotic Recommendation
par: Han, Zihan, et autres
Publié: (2025)
par: Han, Zihan, et autres
Publié: (2025)
Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology
par: D'Amario, Vanessa, et autres
Publié: (2025)
par: D'Amario, Vanessa, et autres
Publié: (2025)
LLM-Empowered Functional Safety and Security by Design in Automotive Systems
par: Petrovic, Nenad, et autres
Publié: (2026)
par: Petrovic, Nenad, et autres
Publié: (2026)
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025)
par: Lu, Yida, et autres
Publié: (2025)
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
par: Zhou, Xiyuan, et autres
Publié: (2025)
par: Zhou, Xiyuan, et autres
Publié: (2025)
PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models
par: Zeng, Min
Publié: (2025)
par: Zeng, Min
Publié: (2025)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
par: Khandekar, Nikhil, et autres
Publié: (2024)
par: Khandekar, Nikhil, et autres
Publié: (2024)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2023)
par: Tu, Shangqing, et autres
Publié: (2023)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
par: Toraman, Çağrı, et autres
Publié: (2026)
par: Toraman, Çağrı, et autres
Publié: (2026)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
par: Zhang, Yazhou, et autres
Publié: (2024)
par: Zhang, Yazhou, et autres
Publié: (2024)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
Evaluating Psychological Safety of Large Language Models
par: Li, Xingxuan, et autres
Publié: (2022)
par: Li, Xingxuan, et autres
Publié: (2022)
StyleBench: Evaluating thinking styles in Large Language Models
par: Guo, Junyu, et autres
Publié: (2025)
par: Guo, Junyu, et autres
Publié: (2025)
Documents similaires
-
Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox
par: Zolfaghari, Vahideh
Publié: (2025) -
When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception
par: Zolfaghari, Vahideh
Publié: (2026) -
RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation
par: Zhao, Jiahao, et autres
Publié: (2025) -
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
par: Han, Tessa, et autres
Publié: (2024) -
Performance Evaluation of Lightweight Open-source Large Language Models in Pediatric Consultations: A Comparative Analysis
par: Wei, Qiuhong, et autres
Publié: (2024)