On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic Phenomena
Fuente:
arXiv
Guardado en:
| Autores principales: | Naous, Tarek, Xu, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
por: Naous, Tarek, et al.
Publicado: (2023)
por: Naous, Tarek, et al.
Publicado: (2023)
Flipping the Dialogue: Training and Evaluating User Language Models
por: Naous, Tarek, et al.
Publicado: (2025)
por: Naous, Tarek, et al.
Publicado: (2025)
What are Foundation Models Cooking in the Post-Soviet World?
por: Lavrouk, Anton, et al.
Publicado: (2025)
por: Lavrouk, Anton, et al.
Publicado: (2025)
Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
por: Naous, Tarek, et al.
Publicado: (2025)
por: Naous, Tarek, et al.
Publicado: (2025)
CARE: Multilingual Human Preference Learning for Cultural Awareness
por: Guo, Geyang, et al.
Publicado: (2025)
por: Guo, Geyang, et al.
Publicado: (2025)
ReadMe++: Benchmarking Multilingual Language Models for Multi-Domain Readability Assessment
por: Naous, Tarek, et al.
Publicado: (2023)
por: Naous, Tarek, et al.
Publicado: (2023)
Reducing Privacy Risks in Online Self-Disclosures with Language Models
por: Dou, Yao, et al.
Publicado: (2023)
por: Dou, Yao, et al.
Publicado: (2023)
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models
por: Liu, Yan, et al.
Publicado: (2024)
por: Liu, Yan, et al.
Publicado: (2024)
Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks
por: Yamaguchi, Atsuki, et al.
Publicado: (2026)
por: Yamaguchi, Atsuki, et al.
Publicado: (2026)
To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs
por: Khan, Zohaib, et al.
Publicado: (2026)
por: Khan, Zohaib, et al.
Publicado: (2026)
Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation
por: Singh, Shivalika, et al.
Publicado: (2024)
por: Singh, Shivalika, et al.
Publicado: (2024)
Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases
por: Hu, Michael Y., et al.
Publicado: (2025)
por: Hu, Michael Y., et al.
Publicado: (2025)
Stanceosaurus 2.0: Classifying Stance Towards Russian and Spanish Misinformation
por: Lavrouk, Anton, et al.
Publicado: (2024)
por: Lavrouk, Anton, et al.
Publicado: (2024)
Strengthening Structural Inductive Biases by Pre-training to Perform Syntactic Transformations
por: Lindemann, Matthias, et al.
Publicado: (2024)
por: Lindemann, Matthias, et al.
Publicado: (2024)
From Robustness to Improved Generalization and Calibration in Pre-trained Language Models
por: Jukić, Josip, et al.
Publicado: (2024)
por: Jukić, Josip, et al.
Publicado: (2024)
Probing Language Models for Pre-training Data Detection
por: Liu, Zhenhua, et al.
Publicado: (2024)
por: Liu, Zhenhua, et al.
Publicado: (2024)
From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models
por: Zhang, Ruiqi, et al.
Publicado: (2026)
por: Zhang, Ruiqi, et al.
Publicado: (2026)
Cultural Biases of Large Language Models and Humans in Historical Interpretation
por: Celli, Fabio, et al.
Publicado: (2025)
por: Celli, Fabio, et al.
Publicado: (2025)
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
por: Yang, Lei, et al.
Publicado: (2025)
por: Yang, Lei, et al.
Publicado: (2025)
DataMan: Data Manager for Pre-training Large Language Models
por: Peng, Ru, et al.
Publicado: (2025)
por: Peng, Ru, et al.
Publicado: (2025)
Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
por: Zhuang, Xinlin, et al.
Publicado: (2025)
por: Zhuang, Xinlin, et al.
Publicado: (2025)
Pre-trained Large Language Models for Financial Sentiment Analysis
por: Luo, Wei, et al.
Publicado: (2024)
por: Luo, Wei, et al.
Publicado: (2024)
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024)
por: Jiang, Minhao, et al.
Publicado: (2024)
EqualizeIR: Mitigating Linguistic Biases in Retrieval Models
por: Cheng, Jiali, et al.
Publicado: (2025)
por: Cheng, Jiali, et al.
Publicado: (2025)
From N-grams to Pre-trained Multilingual Models For Language Identification
por: Sindane, Thapelo, et al.
Publicado: (2024)
por: Sindane, Thapelo, et al.
Publicado: (2024)
AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages
por: Yu, Hao, et al.
Publicado: (2026)
por: Yu, Hao, et al.
Publicado: (2026)
Pre-trained Language Models for Keyphrase Generation: A Thorough Empirical Study
por: Wu, Di, et al.
Publicado: (2022)
por: Wu, Di, et al.
Publicado: (2022)
On Leveraging Encoder-only Pre-trained Language Models for Effective Keyphrase Generation
por: Wu, Di, et al.
Publicado: (2024)
por: Wu, Di, et al.
Publicado: (2024)
Understanding Data Temporality Impact on Large Language Models Pre-training
por: Pilchen, Hippolyte, et al.
Publicado: (2026)
por: Pilchen, Hippolyte, et al.
Publicado: (2026)
RegMix: Data Mixture as Regression for Language Model Pre-training
por: Liu, Qian, et al.
Publicado: (2024)
por: Liu, Qian, et al.
Publicado: (2024)
Cross-Care: Assessing the Healthcare Implications of Pre-training Data on Language Model Bias
por: Chen, Shan, et al.
Publicado: (2024)
por: Chen, Shan, et al.
Publicado: (2024)
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
por: Wang, Shaobo, et al.
Publicado: (2026)
por: Wang, Shaobo, et al.
Publicado: (2026)
Hybrid Human-LLM Corpus Construction and LLM Evaluation for Rare Linguistic Phenomena
por: Weissweiler, Leonie, et al.
Publicado: (2024)
por: Weissweiler, Leonie, et al.
Publicado: (2024)
Metadata Conditioning Accelerates Language Model Pre-training
por: Gao, Tianyu, et al.
Publicado: (2025)
por: Gao, Tianyu, et al.
Publicado: (2025)
Evaluating Discourse Cohesion in Pre-trained Language Models
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
Development of Cognitive Intelligence in Pre-trained Language Models
por: Shah, Raj Sanjay, et al.
Publicado: (2024)
por: Shah, Raj Sanjay, et al.
Publicado: (2024)
Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
por: Ma, Shengjie, et al.
Publicado: (2025)
por: Ma, Shengjie, et al.
Publicado: (2025)
UnMASKed: Quantifying Gender Biases in Masked Language Models through Linguistically Informed Job Market Prompts
por: Parra, Iñigo
Publicado: (2024)
por: Parra, Iñigo
Publicado: (2024)
Fine-tuning Pre-trained Language Models for Few-shot Intent Detection: Supervised Pre-training and Isotropization
por: Zhang, Haode, et al.
Publicado: (2022)
por: Zhang, Haode, et al.
Publicado: (2022)
Model Merging in Pre-training of Large Language Models
por: Li, Yunshui, et al.
Publicado: (2025)
por: Li, Yunshui, et al.
Publicado: (2025)
Ejemplares similares
-
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
por: Naous, Tarek, et al.
Publicado: (2023) -
Flipping the Dialogue: Training and Evaluating User Language Models
por: Naous, Tarek, et al.
Publicado: (2025) -
What are Foundation Models Cooking in the Post-Soviet World?
por: Lavrouk, Anton, et al.
Publicado: (2025) -
Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
por: Naous, Tarek, et al.
Publicado: (2025) -
CARE: Multilingual Human Preference Learning for Cultural Awareness
por: Guo, Geyang, et al.
Publicado: (2025)