Analyzing the Safety of Japanese Large Language Models in Stereotype-Triggering Prompts
Fuente:
arXiv
Saved in:
| Main Authors: | Nakanishi, Akito, Sano, Yukie, Liu, Geng, Pierri, Francesco |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating open-source Large Language Models for automated fact-checking
by: Fontana, Nicolo', et al.
Published: (2025)
by: Fontana, Nicolo', et al.
Published: (2025)
Do Androids Dream of Unseen Puppeteers? Probing for a Conspiracy Mindset in Large Language Models
by: Corso, Francesco, et al.
Published: (2025)
by: Corso, Francesco, et al.
Published: (2025)
Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards
by: Liu, Geng, et al.
Published: (2025)
by: Liu, Geng, et al.
Published: (2025)
Evaluating Reliability Asymmetries in Chinese Factual Search and AI Answers
by: Liu, Geng, et al.
Published: (2025)
by: Liu, Geng, et al.
Published: (2025)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
by: Yang, Yifan, et al.
Published: (2024)
by: Yang, Yifan, et al.
Published: (2024)
Who is better at math, Jenny or Jingzhen? Uncovering Stereotypes in Large Language Models
by: Siddique, Zara, et al.
Published: (2024)
by: Siddique, Zara, et al.
Published: (2024)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
by: Liu, Yiran, et al.
Published: (2024)
by: Liu, Yiran, et al.
Published: (2024)
DECASTE: Unveiling Caste Stereotypes in Large Language Models through Multi-Dimensional Bias Analysis
by: Vijayaraghavan, Prashanth, et al.
Published: (2025)
by: Vijayaraghavan, Prashanth, et al.
Published: (2025)
Divine LLaMAs: Bias, Stereotypes, Stigmatization, and Emotion Representation of Religion in Large Language Models
by: Plaza-del-Arco, Flor Miriam, et al.
Published: (2024)
by: Plaza-del-Arco, Flor Miriam, et al.
Published: (2024)
Addressing Stereotypes in Large Language Models: A Critical Examination and Mitigation
by: Kazi, Fatima
Published: (2025)
by: Kazi, Fatima
Published: (2025)
A Taxonomy of Stereotype Content in Large Language Models
by: Nicolas, Gandalf, et al.
Published: (2024)
by: Nicolas, Gandalf, et al.
Published: (2024)
Evaluating AI capabilities in detecting conspiracy theories on YouTube
by: La Rocca, Leonardo, et al.
Published: (2025)
by: La Rocca, Leonardo, et al.
Published: (2025)
A Survey on Stereotype Detection in Natural Language Processing
by: Cignarella, Alessandra Teresa, et al.
Published: (2025)
by: Cignarella, Alessandra Teresa, et al.
Published: (2025)
Challenging Negative Gender Stereotypes: A Study on the Effectiveness of Automated Counter-Stereotypes
by: Nejadgholi, Isar, et al.
Published: (2024)
by: Nejadgholi, Isar, et al.
Published: (2024)
An Empirical Investigation of Gender Stereotype Representation in Large Language Models: The Italian Case
by: Giachino, Gioele, et al.
Published: (2025)
by: Giachino, Gioele, et al.
Published: (2025)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
by: Gallegos, Isabel O., et al.
Published: (2024)
by: Gallegos, Isabel O., et al.
Published: (2024)
When People are Floods: Analyzing Dehumanizing Metaphors in Immigration Discourse with Large Language Models
by: Mendelsohn, Julia, et al.
Published: (2025)
by: Mendelsohn, Julia, et al.
Published: (2025)
AI Safety in Generative AI Large Language Models: A Survey
by: Chua, Jaymari, et al.
Published: (2024)
by: Chua, Jaymari, et al.
Published: (2024)
Local Contrastive Editing of Gender Stereotypes
by: Lutz, Marlene, et al.
Published: (2024)
by: Lutz, Marlene, et al.
Published: (2024)
Comparing diversity, negativity, and stereotypes in Chinese-language AI technologies: an investigation of Baidu, Ernie and Qwen
by: Liu, Geng, et al.
Published: (2024)
by: Liu, Geng, et al.
Published: (2024)
Evaluating Psychological Safety of Large Language Models
by: Li, Xingxuan, et al.
Published: (2022)
by: Li, Xingxuan, et al.
Published: (2022)
Overreliance on AI in Information-seeking from Video Content
by: Møller, Anders Giovanni, et al.
Published: (2026)
by: Møller, Anders Giovanni, et al.
Published: (2026)
Nicer Than Humans: How do Large Language Models Behave in the Prisoner's Dilemma?
by: Fontana, Nicoló, et al.
Published: (2024)
by: Fontana, Nicoló, et al.
Published: (2024)
Evaluating Proactive Risk Awareness of Large Language Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
SESGO: Spanish Evaluation of Stereotypical Generative Outputs
by: Robles, Melissa, et al.
Published: (2025)
by: Robles, Melissa, et al.
Published: (2025)
How Large Language Models (LLMs) Extrapolate: From Guided Missiles to Guided Prompts
by: Cao, Xuenan
Published: (2024)
by: Cao, Xuenan
Published: (2024)
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
by: Friedrich, Felix, et al.
Published: (2024)
by: Friedrich, Felix, et al.
Published: (2024)
Assessing Historical Structural Oppression Worldwide via Rule-Guided Prompting of Large Language Models
by: Chatterjee, Sreejato, et al.
Published: (2025)
by: Chatterjee, Sreejato, et al.
Published: (2025)
Concept-Guided Chain-of-Thought Prompting for Pairwise Comparison Scoring of Texts with Large Language Models
by: Wu, Patrick Y., et al.
Published: (2023)
by: Wu, Patrick Y., et al.
Published: (2023)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Towards an Automated Framework to Audit Youth Safety on TikTok
by: Xue, Linda, et al.
Published: (2025)
by: Xue, Linda, et al.
Published: (2025)
A comparison of online search engine autocompletion in Google and Baidu
by: Liu, Geng, et al.
Published: (2024)
by: Liu, Geng, et al.
Published: (2024)
The Price of Prompting: Profiling Energy Use in Large Language Models Inference
by: Husom, Erik Johannes, et al.
Published: (2024)
by: Husom, Erik Johannes, et al.
Published: (2024)
If there's a Trigger Warning, then where's the Trigger? Investigating Trigger Warnings at the Passage Level
by: Wiegmann, Matti, et al.
Published: (2024)
by: Wiegmann, Matti, et al.
Published: (2024)
Cultural Value Differences of LLMs: Prompt, Language, and Model Size
by: Zhong, Qishuai, et al.
Published: (2024)
by: Zhong, Qishuai, et al.
Published: (2024)
Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs
by: Saeed, Muhammed, et al.
Published: (2025)
by: Saeed, Muhammed, et al.
Published: (2025)
Position is Power: System Prompts as a Mechanism of Bias in Large Language Models (LLMs)
by: Neumann, Anna, et al.
Published: (2025)
by: Neumann, Anna, et al.
Published: (2025)
Prompt Selection Matters: Enhancing Text Annotations for Social Sciences with Large Language Models
by: Abraham, Louis, et al.
Published: (2024)
by: Abraham, Louis, et al.
Published: (2024)
On the Reliability of Large Language Models to Misinformed and Demographically-Informed Prompts
by: Aremu, Toluwani, et al.
Published: (2024)
by: Aremu, Toluwani, et al.
Published: (2024)
Phare: A Safety Probe for Large Language Models
by: Jeune, Pierre Le, et al.
Published: (2025)
by: Jeune, Pierre Le, et al.
Published: (2025)
Similar Items
-
Evaluating open-source Large Language Models for automated fact-checking
by: Fontana, Nicolo', et al.
Published: (2025) -
Do Androids Dream of Unseen Puppeteers? Probing for a Conspiracy Mindset in Large Language Models
by: Corso, Francesco, et al.
Published: (2025) -
Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards
by: Liu, Geng, et al.
Published: (2025) -
Evaluating Reliability Asymmetries in Chinese Factual Search and AI Answers
by: Liu, Geng, et al.
Published: (2025) -
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
by: Yang, Yifan, et al.
Published: (2024)