Can LLMs Grasp Implicit Cultural Values? Benchmarking LLMs' Cultural Intelligence with CQ-Bench
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Ziyi, Dey, Priyanka, Huang, Jen-tse, Zhao, Zhenyu, Jiang, Bowen, Gupta, Rahul, Liu, Yang, Du, Yao, Zhao, Jieyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can LLMs Express Personality Across Cultures? Introducing CulturalPersonas for Evaluating Trait Alignment
par: Dey, Priyanka, et autres
Publié: (2025)
par: Dey, Priyanka, et autres
Publié: (2025)
InterIntent: Investigating Social Intelligence of LLMs via Intention Understanding in an Interactive Game Context
par: Liu, Ziyi, et autres
Publié: (2024)
par: Liu, Ziyi, et autres
Publié: (2024)
FairCoder: Evaluating Social Bias of LLMs in Code Generation
par: Du, Yongkang, et autres
Publié: (2025)
par: Du, Yongkang, et autres
Publié: (2025)
AI Sees Your Location, But With A Bias Toward The Wealthy World
par: Huang, Jingyuan, et autres
Publié: (2025)
par: Huang, Jingyuan, et autres
Publié: (2025)
ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?
par: Li, Shuqing, et autres
Publié: (2025)
par: Li, Shuqing, et autres
Publié: (2025)
ExpressivityBench: Can LLMs Communicate Implicitly?
par: Tint, Joshua, et autres
Publié: (2024)
par: Tint, Joshua, et autres
Publié: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
par: Huang, Jen-tse, et autres
Publié: (2025)
par: Huang, Jen-tse, et autres
Publié: (2025)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench
par: Huang, Jen-tse, et autres
Publié: (2023)
par: Huang, Jen-tse, et autres
Publié: (2023)
Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment
par: Tan, Bryan Chen Zhengyu, et autres
Publié: (2026)
par: Tan, Bryan Chen Zhengyu, et autres
Publié: (2026)
Self-Contradictory Reasoning Evaluation and Detection
par: Liu, Ziyi, et autres
Publié: (2023)
par: Liu, Ziyi, et autres
Publié: (2023)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2026)
par: Kabir, Mohsinul, et autres
Publié: (2026)
Evaluating the Impact of Two Globalization Projects on College Students' Cultural Competence and Cultural Intelligence (CQ)
par: Lopes-Murphy, Solange A.
Publié: (2013)
par: Lopes-Murphy, Solange A.
Publié: (2013)
MasalBench: A Benchmark for Contextual and Cross-Cultural Understanding of Persian Proverbs in LLMs
par: Kalhor, Ghazal, et autres
Publié: (2026)
par: Kalhor, Ghazal, et autres
Publié: (2026)
From Surveys to Narratives: Rethinking Cultural Value Adaptation in LLMs
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2025)
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2025)
LLMs and Cultural Values: the Impact of Prompt Language and Explicit Cultural Framing
par: Bulté, Bram, et autres
Publié: (2025)
par: Bulté, Bram, et autres
Publié: (2025)
Reading between the Lines: Can LLMs Identify Cross-Cultural Communication Gaps?
par: Saha, Sougata, et autres
Publié: (2025)
par: Saha, Sougata, et autres
Publié: (2025)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
par: Zhao, Wenlong, et autres
Publié: (2024)
par: Zhao, Wenlong, et autres
Publié: (2024)
Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
par: Dai, Chongyuan, et autres
Publié: (2026)
par: Dai, Chongyuan, et autres
Publié: (2026)
Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench
par: Huang, Jen-tse, et autres
Publié: (2023)
par: Huang, Jen-tse, et autres
Publié: (2023)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
par: Liu, Xiaoyuan, et autres
Publié: (2024)
par: Liu, Xiaoyuan, et autres
Publié: (2024)
How Well Can LLMs Echo Us? Evaluating AI Chatbots' Role-Play Ability with ECHO
par: Ng, Man Tik, et autres
Publié: (2024)
par: Ng, Man Tik, et autres
Publié: (2024)
Beyond Western Politics: Cross-Cultural Benchmarks for Evaluating Partisan Associations in LLMs
par: Kumar, Divyanshu, et autres
Publié: (2025)
par: Kumar, Divyanshu, et autres
Publié: (2025)
CULEMO: Cultural Lenses on Emotion -- Benchmarking LLMs for Cross-Cultural Emotion Understanding
par: Belay, Tadesse Destaw, et autres
Publié: (2025)
par: Belay, Tadesse Destaw, et autres
Publié: (2025)
BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction
par: Sijan, Tanvir Ahmed, et autres
Publié: (2026)
par: Sijan, Tanvir Ahmed, et autres
Publié: (2026)
Auditing Preferences for Brands and Cultures in LLMs
par: Rienecker, Jasmine, et autres
Publié: (2026)
par: Rienecker, Jasmine, et autres
Publié: (2026)
LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction
par: Tonga, Junior Cedric, et autres
Publié: (2026)
par: Tonga, Junior Cedric, et autres
Publié: (2026)
BIASINSPECTOR: Detecting Bias in Structured Data through LLM Agents
par: Li, Haoxuan, et autres
Publié: (2025)
par: Li, Haoxuan, et autres
Publié: (2025)
OSS-Bench: Benchmark Generator for Coding LLMs
par: Jiang, Yuancheng, et autres
Publié: (2025)
par: Jiang, Yuancheng, et autres
Publié: (2025)
CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming
par: Chiu, Yu Ying, et autres
Publié: (2024)
par: Chiu, Yu Ying, et autres
Publié: (2024)
Culturally-Aware Conversations: A Framework & Benchmark for LLMs
par: Havaldar, Shreya, et autres
Publié: (2025)
par: Havaldar, Shreya, et autres
Publié: (2025)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
par: Naous, Tarek, et autres
Publié: (2025)
par: Naous, Tarek, et autres
Publié: (2025)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
par: Zou, Henry Peng, et autres
Publié: (2024)
par: Zou, Henry Peng, et autres
Publié: (2024)
Cultural Value Differences of LLMs: Prompt, Language, and Model Size
par: Zhong, Qishuai, et autres
Publié: (2024)
par: Zhong, Qishuai, et autres
Publié: (2024)
'Since Lawyers are Males..': Examining Implicit Gender Bias in Hindi Language Generation by LLMs
par: Joshi, Ishika, et autres
Publié: (2024)
par: Joshi, Ishika, et autres
Publié: (2024)
HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs
par: Liu, Jiaxin, et autres
Publié: (2025)
par: Liu, Jiaxin, et autres
Publié: (2025)
LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs
par: Lian, Da-Chen, et autres
Publié: (2025)
par: Lian, Da-Chen, et autres
Publié: (2025)
ConvexBench: Can LLMs Recognize Convex Functions?
par: Liu, Yepeng, et autres
Publié: (2026)
par: Liu, Yepeng, et autres
Publié: (2026)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
Documents similaires
-
Can LLMs Express Personality Across Cultures? Introducing CulturalPersonas for Evaluating Trait Alignment
par: Dey, Priyanka, et autres
Publié: (2025) -
InterIntent: Investigating Social Intelligence of LLMs via Intention Understanding in an Interactive Game Context
par: Liu, Ziyi, et autres
Publié: (2024) -
FairCoder: Evaluating Social Bias of LLMs in Code Generation
par: Du, Yongkang, et autres
Publié: (2025) -
AI Sees Your Location, But With A Bias Toward The Wealthy World
par: Huang, Jingyuan, et autres
Publié: (2025) -
ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?
par: Li, Shuqing, et autres
Publié: (2025)