Is It Bad to Work All the Time? Cross-Cultural Evaluation of Social Norm Biases in GPT-4
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Zhuozhuo Joy, Samir, Farhan, Bhatia, Mehar, Nelson, Laura K., Shwartz, Vered |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
par: Bhatia, Mehar, et autres
Publié: (2024)
par: Bhatia, Mehar, et autres
Publié: (2024)
Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia
par: Samir, Farhan, et autres
Publié: (2024)
par: Samir, Farhan, et autres
Publié: (2024)
Value Drifts: Tracing Value Alignment During LLM Post-Training
par: Bhatia, Mehar, et autres
Publié: (2025)
par: Bhatia, Mehar, et autres
Publié: (2025)
WikiGap: Promoting Epistemic Equity by Surfacing Knowledge Gaps Between English Wikipedia and other Language Editions
par: Wang, Zining, et autres
Publié: (2025)
par: Wang, Zining, et autres
Publié: (2025)
Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
par: Samir, Farhan, et autres
Publié: (2024)
par: Samir, Farhan, et autres
Publié: (2024)
CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming
par: Chiu, Yu Ying, et autres
Publié: (2024)
par: Chiu, Yu Ying, et autres
Publié: (2024)
Stance Reasoner: Zero-Shot Stance Detection on Social Media with Explicit Reasoning
par: Taranukhin, Maksym, et autres
Publié: (2024)
par: Taranukhin, Maksym, et autres
Publié: (2024)
CulturalTeaming: AI-Assisted Interactive Red-Teaming for Challenging LLMs' (Lack of) Multicultural Knowledge
par: Chiu, Yu Ying, et autres
Publié: (2024)
par: Chiu, Yu Ying, et autres
Publié: (2024)
BottleHumor: Self-Informed Humor Explanation using the Information Bottleneck Principle
par: Hwang, EunJeong, et autres
Publié: (2025)
par: Hwang, EunJeong, et autres
Publié: (2025)
CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law
par: Zhao, Ethan, et autres
Publié: (2026)
par: Zhao, Ethan, et autres
Publié: (2026)
Infusing Theory of Mind into Socially Intelligent LLM Agents
par: Hwang, EunJeong, et autres
Publié: (2025)
par: Hwang, EunJeong, et autres
Publié: (2025)
CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics
par: Nayak, Shravan, et autres
Publié: (2025)
par: Nayak, Shravan, et autres
Publié: (2025)
Is GPT-4 Less Politically Biased than GPT-3.5? A Renewed Investigation of ChatGPT's Political Biases
par: Weber, Erik, et autres
Publié: (2024)
par: Weber, Erik, et autres
Publié: (2024)
Empowering Air Travelers: A Chatbot for Canadian Air Passenger Rights
par: Taranukhin, Maksym, et autres
Publié: (2024)
par: Taranukhin, Maksym, et autres
Publié: (2024)
Bridging Information Gaps with Comprehensive Answers: Improving the Diversity and Informativeness of Follow-Up Questions
par: Liu, Zhe, et autres
Publié: (2025)
par: Liu, Zhe, et autres
Publié: (2025)
SPIKE-RL: Video-LLMs meet Bayesian Surprise
par: Ravi, Sahithya, et autres
Publié: (2025)
par: Ravi, Sahithya, et autres
Publié: (2025)
CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs
par: Ye, Yangfan, et autres
Publié: (2026)
par: Ye, Yangfan, et autres
Publié: (2026)
Robust Evaluation Measures for Evaluating Social Biases in Masked Language Models
par: Liu, Yang
Publié: (2024)
par: Liu, Yang
Publié: (2024)
InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning
par: Taranukhin, Maksym, et autres
Publié: (2026)
par: Taranukhin, Maksym, et autres
Publié: (2026)
Team ACK at SemEval-2025 Task 2: Beyond Word-for-Word Machine Translation for English-Korean Pairs
par: Lee, Daniel, et autres
Publié: (2025)
par: Lee, Daniel, et autres
Publié: (2025)
Evaluating the Effect of Retrieval Augmentation on Social Biases
par: Zhang, Tianhui, et autres
Publié: (2025)
par: Zhang, Tianhui, et autres
Publié: (2025)
Games That Teach, Chats That Convince: Comparing Interactive and Static Formats for Persuasive Learning
par: Alavi, Seyed Hossein, et autres
Publié: (2026)
par: Alavi, Seyed Hossein, et autres
Publié: (2026)
Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation
par: Singh, Shivalika, et autres
Publié: (2024)
par: Singh, Shivalika, et autres
Publié: (2024)
Breaking Bad: Norms for Valence, Arousal, and Dominance for over 10k English Multiword Expressions
par: Mohammad, Saif M.
Publié: (2025)
par: Mohammad, Saif M.
Publié: (2025)
Do LLMs Align Human Values Regarding Social Biases? Judging and Explaining Social Biases with LLMs
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Small But Funny: A Feedback-Driven Approach to Humor Distillation
par: Ravi, Sahithya, et autres
Publié: (2024)
par: Ravi, Sahithya, et autres
Publié: (2024)
The Silicon Ceiling: Auditing GPT's Race and Gender Biases in Hiring
par: Armstrong, Lena, et autres
Publié: (2024)
par: Armstrong, Lena, et autres
Publié: (2024)
Questionnaires for Everyone: Streamlining Cross-Cultural Questionnaire Adaptation with GPT-Based Translation Quality Evaluation
par: Haavisto, Otso, et autres
Publié: (2024)
par: Haavisto, Otso, et autres
Publié: (2024)
Expressing Social Emotions: Misalignment Between LLMs and Human Cultural Emotion Norms
par: Bhattacharyya, Sree, et autres
Publié: (2026)
par: Bhattacharyya, Sree, et autres
Publié: (2026)
Swan and ArabicMTEB: Dialect-Aware, Arabic-Centric, Cross-Lingual, and Cross-Cultural Embedding Models and Benchmarks
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
ABCD: All Biases Come Disguised
par: Nowak, Mateusz, et autres
Publié: (2026)
par: Nowak, Mateusz, et autres
Publié: (2026)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
MINDS: A Cross-cultural Dialogue Corpus for Social Norm Classification and Adherence Detection
par: Sahu, Pritish, et autres
Publié: (2025)
par: Sahu, Pritish, et autres
Publié: (2025)
LLMs are Biased Evaluators But Not Biased for Retrieval Augmented Generation
par: Chen, Yen-Shan, et autres
Publié: (2024)
par: Chen, Yen-Shan, et autres
Publié: (2024)
FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
NormSAGE: Multi-Lingual Multi-Cultural Norm Discovery from Conversations On-the-Fly
par: Fung, Yi R., et autres
Publié: (2022)
par: Fung, Yi R., et autres
Publié: (2022)
TimeWarp: Evaluating Web Agents by Revisiting the Past
par: Ishmam, Md Farhan, et autres
Publié: (2026)
par: Ishmam, Md Farhan, et autres
Publié: (2026)
GPT-4 as Evaluator: Evaluating Large Language Models on Pest Management in Agriculture
par: Yang, Shanglong, et autres
Publié: (2024)
par: Yang, Shanglong, et autres
Publié: (2024)
BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models
par: Xie, Tian, et autres
Publié: (2025)
par: Xie, Tian, et autres
Publié: (2025)
Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
par: Naous, Tarek, et autres
Publié: (2025)
par: Naous, Tarek, et autres
Publié: (2025)
Documents similaires
-
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
par: Bhatia, Mehar, et autres
Publié: (2024) -
Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia
par: Samir, Farhan, et autres
Publié: (2024) -
Value Drifts: Tracing Value Alignment During LLM Post-Training
par: Bhatia, Mehar, et autres
Publié: (2025) -
WikiGap: Promoting Epistemic Equity by Surfacing Knowledge Gaps Between English Wikipedia and other Language Editions
par: Wang, Zining, et autres
Publié: (2025) -
Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
par: Samir, Farhan, et autres
Publié: (2024)