CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yuhang, Zhu, Yanxu, Kong, Chao, Wei, Shuyu, Yi, Xiaoyuan, Xie, Xing, Sang, Jitao |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning
par: Sang, Jitao, et autres
Publié: (2024)
par: Sang, Jitao, et autres
Publié: (2024)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing
par: Jiang, Han, et autres
Publié: (2024)
par: Jiang, Han, et autres
Publié: (2024)
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
par: Zhu, Yanxu, et autres
Publié: (2024)
par: Zhu, Yanxu, et autres
Publié: (2024)
Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning
par: Duan, Shitong, et autres
Publié: (2023)
par: Duan, Shitong, et autres
Publié: (2023)
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
par: Wang, Yuhang, et autres
Publié: (2024)
par: Wang, Yuhang, et autres
Publié: (2024)
Cultural Alignment in Large Language Models: An Explanatory Analysis Based on Hofstede's Cultural Dimensions
par: Masoud, Reem I., et autres
Publié: (2023)
par: Masoud, Reem I., et autres
Publié: (2023)
PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization
par: Jiang, Han, et autres
Publié: (2025)
par: Jiang, Han, et autres
Publié: (2025)
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
par: Bai, Yuzhuo, et autres
Publié: (2025)
par: Bai, Yuzhuo, et autres
Publié: (2025)
Measuring Large Language Models Capacity to Annotate Journalistic Sourcing
par: Vincent, Subramaniam, et autres
Publié: (2024)
par: Vincent, Subramaniam, et autres
Publié: (2024)
Investigating Cultural Alignment of Large Language Models
par: AlKhamissi, Badr, et autres
Publié: (2024)
par: AlKhamissi, Badr, et autres
Publié: (2024)
On Classification with Large Language Models in Cultural Analytics
par: Bamman, David, et autres
Publié: (2024)
par: Bamman, David, et autres
Publié: (2024)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
par: Zhao, Wenlong, et autres
Publié: (2024)
par: Zhao, Wenlong, et autres
Publié: (2024)
The Incomplete Bridge: How AI Research (Mis)Engages with Psychology
par: Jiang, Han, et autres
Publié: (2025)
par: Jiang, Han, et autres
Publié: (2025)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
par: Lee, Jaehyeok, et autres
Publié: (2026)
par: Lee, Jaehyeok, et autres
Publié: (2026)
Extrinsic Evaluation of Cultural Competence in Large Language Models
par: Bhatt, Shaily, et autres
Publié: (2024)
par: Bhatt, Shaily, et autres
Publié: (2024)
AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference
par: Yao, Jing, et autres
Publié: (2025)
par: Yao, Jing, et autres
Publié: (2025)
AuditWen:An Open-Source Large Language Model for Audit
par: Huang, Jiajia, et autres
Publié: (2024)
par: Huang, Jiajia, et autres
Publié: (2024)
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
MoVa: Towards Generalizable Classification of Human Morals and Values
par: Chen, Ziyu, et autres
Publié: (2025)
par: Chen, Ziyu, et autres
Publié: (2025)
Measuring Implicit Bias in Explicitly Unbiased Large Language Models
par: Bai, Xuechunzi, et autres
Publié: (2024)
par: Bai, Xuechunzi, et autres
Publié: (2024)
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
par: Chen, Zhongren, et autres
Publié: (2026)
par: Chen, Zhongren, et autres
Publié: (2026)
Leveraging Large Language Models to Measure Gender Representation Bias in Gendered Language Corpora
par: Derner, Erik, et autres
Publié: (2024)
par: Derner, Erik, et autres
Publié: (2024)
Climate Change from Large Language Models
par: Zhu, Hongyin, et autres
Publié: (2023)
par: Zhu, Hongyin, et autres
Publié: (2023)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
par: Lyu, Hanjia, et autres
Publié: (2025)
par: Lyu, Hanjia, et autres
Publié: (2025)
Urban Computing in the Era of Large Language Models
par: Li, Zhonghang, et autres
Publié: (2025)
par: Li, Zhonghang, et autres
Publié: (2025)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
par: Xu, Liuchang, et autres
Publié: (2024)
par: Xu, Liuchang, et autres
Publié: (2024)
WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models
par: Mushtaq, Abdullah, et autres
Publié: (2025)
par: Mushtaq, Abdullah, et autres
Publié: (2025)
WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models
par: Felkner, Virginia K., et autres
Publié: (2023)
par: Felkner, Virginia K., et autres
Publié: (2023)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
par: Yang, Yan, et autres
Publié: (2025)
par: Yang, Yan, et autres
Publié: (2025)
Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition
par: Kim, Kyuhee, et autres
Publié: (2025)
par: Kim, Kyuhee, et autres
Publié: (2025)
Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models
par: Khandelwal, Khyati, et autres
Publié: (2023)
par: Khandelwal, Khyati, et autres
Publié: (2023)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
par: Tu, Yahan, et autres
Publié: (2024)
par: Tu, Yahan, et autres
Publié: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
DarkBench: Benchmarking Dark Patterns in Large Language Models
par: Kran, Esben, et autres
Publié: (2025)
par: Kran, Esben, et autres
Publié: (2025)
Only a Little to the Left: A Theory-grounded Measure of Political Bias in Large Language Models
par: Faulborn, Mats, et autres
Publié: (2025)
par: Faulborn, Mats, et autres
Publié: (2025)
Measuring Human Contribution in AI-Assisted Content Generation
par: Xie, Yueqi, et autres
Publié: (2024)
par: Xie, Yueqi, et autres
Publié: (2024)
Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights
par: Choi, Sooyung, et autres
Publié: (2025)
par: Choi, Sooyung, et autres
Publié: (2025)
Cultural Value Differences of LLMs: Prompt, Language, and Model Size
par: Zhong, Qishuai, et autres
Publié: (2024)
par: Zhong, Qishuai, et autres
Publié: (2024)
Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
par: Rao, Pooja S. B., et autres
Publié: (2025)
par: Rao, Pooja S. B., et autres
Publié: (2025)
Documents similaires
-
Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning
par: Sang, Jitao, et autres
Publié: (2024) -
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
par: Wang, Yuhang, et autres
Publié: (2025) -
Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing
par: Jiang, Han, et autres
Publié: (2024) -
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
par: Zhu, Yanxu, et autres
Publié: (2024) -
Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning
par: Duan, Shitong, et autres
Publié: (2023)