SaudiCulture: A Benchmark for Evaluating Large Language Models Cultural Competence within Saudi Arabia
Fuente:
arXiv
Saved in:
| Main Authors: | Ayash, Lama, Alhuzali, Hassan, Alasmari, Ashwag, Aloufi, Sultan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Words to Proverbs: Evaluating LLMs Linguistic and Cultural Competence in Saudi Dialects with Absher
by: Al-Monef, Renad, et al.
Published: (2025)
by: Al-Monef, Renad, et al.
Published: (2025)
Evaluating the Effectiveness of the Foundational Models for Q&A Classification in Mental Health care
by: Alhuzali, Hassan, et al.
Published: (2024)
by: Alhuzali, Hassan, et al.
Published: (2024)
MentalQA: An Annotated Arabic Corpus for Questions and Answers of Mental Healthcare
by: Alhuzali, Hassan, et al.
Published: (2024)
by: Alhuzali, Hassan, et al.
Published: (2024)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
by: Kabir, Mohsinul, et al.
Published: (2026)
by: Kabir, Mohsinul, et al.
Published: (2026)
SaudiBERT: A Large Language Model Pretrained on Saudi Dialect Corpora
by: Qarah, Faisal
Published: (2024)
by: Qarah, Faisal
Published: (2024)
Continuous Saudi Sign Language Recognition: A Vision Transformer Approach
by: Elhassen, Soukeina, et al.
Published: (2025)
by: Elhassen, Soukeina, et al.
Published: (2025)
Generative AI in Saudi Arabia: A National Survey of Adoption, Risks, and Public Perceptions
by: AlDakheel, Abdulaziz, et al.
Published: (2026)
by: AlDakheel, Abdulaziz, et al.
Published: (2026)
Investigating Persuasion Techniques in Arabic: An Empirical Study Leveraging Large Language Models
by: Alzahrani, Abdurahmman, et al.
Published: (2024)
by: Alzahrani, Abdurahmman, et al.
Published: (2024)
Cultural Bias and Cultural Alignment of Large Language Models
by: Tao, Yan, et al.
Published: (2023)
by: Tao, Yan, et al.
Published: (2023)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
by: Li, Zheqing, et al.
Published: (2025)
by: Li, Zheqing, et al.
Published: (2025)
CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
by: Lin, Peiqin, et al.
Published: (2026)
by: Lin, Peiqin, et al.
Published: (2026)
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
by: Kang, Hankun, et al.
Published: (2026)
by: Kang, Hankun, et al.
Published: (2026)
WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models
by: Mushtaq, Abdullah, et al.
Published: (2025)
by: Mushtaq, Abdullah, et al.
Published: (2025)
Risks of Cultural Erasure in Large Language Models
by: Qadri, Rida, et al.
Published: (2025)
by: Qadri, Rida, et al.
Published: (2025)
Meta-Cultural Competence: Climbing the Right Hill of Cultural Awareness
by: Saha, Sougata, et al.
Published: (2025)
by: Saha, Sougata, et al.
Published: (2025)
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
by: Kim, Dahyun, et al.
Published: (2024)
by: Kim, Dahyun, et al.
Published: (2024)
CultureLLM: Incorporating Cultural Differences into Large Language Models
by: Li, Cheng, et al.
Published: (2024)
by: Li, Cheng, et al.
Published: (2024)
Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires
by: Münker, Simon
Published: (2025)
by: Münker, Simon
Published: (2025)
Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports
by: Singh, Punit Kumar, et al.
Published: (2025)
by: Singh, Punit Kumar, et al.
Published: (2025)
Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
by: Rao, Pooja S. B., et al.
Published: (2025)
by: Rao, Pooja S. B., et al.
Published: (2025)
AraHealthQA 2025: The First Shared Task on Arabic Health Question Answering
by: Alhuzali, Hassan, et al.
Published: (2025)
by: Alhuzali, Hassan, et al.
Published: (2025)
CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks
by: Qian, Zhaozhi, et al.
Published: (2024)
by: Qian, Zhaozhi, et al.
Published: (2024)
Benchmarking Vision Language Models for Cultural Understanding
by: Nayak, Shravan, et al.
Published: (2024)
by: Nayak, Shravan, et al.
Published: (2024)
Cultural Fidelity in Large-Language Models: An Evaluation of Online Language Resources as a Driver of Model Performance in Value Representation
by: Kazemi, Sharif, et al.
Published: (2024)
by: Kazemi, Sharif, et al.
Published: (2024)
Uncovering Competency Gaps in Large Language Models and Their Benchmarks
by: Bohacek, Maty, et al.
Published: (2025)
by: Bohacek, Maty, et al.
Published: (2025)
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
by: Veselovsky, Veniamin, et al.
Published: (2025)
by: Veselovsky, Veniamin, et al.
Published: (2025)
Exploring Cultural Variations in Moral Judgments with Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
Prompt Programming for Cultural Bias and Alignment of Large Language Models
by: Eren, Maksim, et al.
Published: (2026)
by: Eren, Maksim, et al.
Published: (2026)
IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages
by: Hanif, Ikhlasul Akmal, et al.
Published: (2026)
by: Hanif, Ikhlasul Akmal, et al.
Published: (2026)
TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
by: Akinode, Victor, et al.
Published: (2026)
by: Akinode, Victor, et al.
Published: (2026)
A Novel Psychometrics-Based Approach to Developing Professional Competency Benchmark for Large Language Models
by: Kardanova, Elena, et al.
Published: (2024)
by: Kardanova, Elena, et al.
Published: (2024)
Entangled in Representations: Mechanistic Investigation of Cultural Biases in Large Language Models
by: Yu, Haeun, et al.
Published: (2025)
by: Yu, Haeun, et al.
Published: (2025)
ALIGN: Word Association Learning for Cultural Alignment in Large Language Models
by: Liu, Chunhua, et al.
Published: (2025)
by: Liu, Chunhua, et al.
Published: (2025)
JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
by: Jin, Jiho, et al.
Published: (2026)
by: Jin, Jiho, et al.
Published: (2026)
Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
by: Wang, Wenxuan, et al.
Published: (2023)
by: Wang, Wenxuan, et al.
Published: (2023)
Methodology of Adapting Large English Language Models for Specific Cultural Contexts
by: Zhang, Wenjing, et al.
Published: (2024)
by: Zhang, Wenjing, et al.
Published: (2024)
SDUs DAISY: A Benchmark for Danish Culture
by: Nielsen, Jacob, et al.
Published: (2026)
by: Nielsen, Jacob, et al.
Published: (2026)
From Words to Worlds: Benchmarking Cross-Cultural Cultural Understanding in Machine Translation
by: Han, Bangju, et al.
Published: (2026)
by: Han, Bangju, et al.
Published: (2026)
AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language Models
by: Beux, Yann Le, et al.
Published: (2025)
by: Beux, Yann Le, et al.
Published: (2025)
Exploring Large Language Models on Cross-Cultural Values in Connection with Training Methodology
by: Kim, Minsang, et al.
Published: (2024)
by: Kim, Minsang, et al.
Published: (2024)
Similar Items
-
From Words to Proverbs: Evaluating LLMs Linguistic and Cultural Competence in Saudi Dialects with Absher
by: Al-Monef, Renad, et al.
Published: (2025) -
Evaluating the Effectiveness of the Foundational Models for Q&A Classification in Mental Health care
by: Alhuzali, Hassan, et al.
Published: (2024) -
MentalQA: An Annotated Arabic Corpus for Questions and Answers of Mental Healthcare
by: Alhuzali, Hassan, et al.
Published: (2024) -
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
by: Kabir, Mohsinul, et al.
Published: (2026) -
SaudiBERT: A Large Language Model Pretrained on Saudi Dialect Corpora
by: Qarah, Faisal
Published: (2024)