The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It
Fuente:
arXiv
Saved in:
| Main Authors: | Yong, Zheng-Xin, Ermis, Beyza, Fadaee, Marzieh, Bach, Stephen H., Kreutzer, Julia |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
by: Aakanksha, et al.
Published: (2024)
by: Aakanksha, et al.
Published: (2024)
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
by: Kreutzer, Julia, et al.
Published: (2025)
by: Kreutzer, Julia, et al.
Published: (2025)
The Multilingual Divide and Its Impact on Global AI Safety
by: Peppin, Aidan, et al.
Published: (2025)
by: Peppin, Aidan, et al.
Published: (2025)
The Art of Asking: Multilingual Prompt Optimization for Synthetic Data
by: Mora, David, et al.
Published: (2025)
by: Mora, David, et al.
Published: (2025)
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
by: Shimabucoro, Luísa, et al.
Published: (2024)
by: Shimabucoro, Luísa, et al.
Published: (2024)
Mix Data or Merge Models? Optimizing for Diverse Multi-Task Learning
by: Aakanksha, et al.
Published: (2024)
by: Aakanksha, et al.
Published: (2024)
Making, not Taking, the Best of N
by: Khairi, Ammar, et al.
Published: (2025)
by: Khairi, Ammar, et al.
Published: (2025)
From One to Many: Expanding the Scope of Toxicity Mitigation in Language Models
by: Pozzobon, Luiza, et al.
Published: (2024)
by: Pozzobon, Luiza, et al.
Published: (2024)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
by: Yong, Zheng-Xin, et al.
Published: (2025)
by: Yong, Zheng-Xin, et al.
Published: (2025)
Multilingual Arbitrage: Optimizing Data Pools to Accelerate Multilingual Progress
by: Odumakinde, Ayomide, et al.
Published: (2024)
by: Odumakinde, Ayomide, et al.
Published: (2024)
Preference Tuning For Toxicity Mitigation Generalizes Across Languages
by: Li, Xiaochen, et al.
Published: (2024)
by: Li, Xiaochen, et al.
Published: (2024)
Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model
by: Üstün, Ahmet, et al.
Published: (2024)
by: Üstün, Ahmet, et al.
Published: (2024)
A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics
by: Shimabucoro, Luisa, et al.
Published: (2025)
by: Shimabucoro, Luisa, et al.
Published: (2025)
Tiny Aya: Bridging Scale and Multilingual Depth
by: Salamanca, Alejandro R., et al.
Published: (2026)
by: Salamanca, Alejandro R., et al.
Published: (2026)
NeoBabel: A Multilingual Open Tower for Visual Generation
by: Derakhshani, Mohammad Mahdi, et al.
Published: (2025)
by: Derakhshani, Mohammad Mahdi, et al.
Published: (2025)
Investigating Continual Pretraining in Large Language Models: Insights and Implications
by: Yıldız, Çağatay, et al.
Published: (2024)
by: Yıldız, Çağatay, et al.
Published: (2024)
LexC-Gen: Generating Data for Extremely Low-Resource Languages with Large Language Models and Bilingual Lexicons
by: Yong, Zheng-Xin, et al.
Published: (2024)
by: Yong, Zheng-Xin, et al.
Published: (2024)
One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual Tokenizers
by: Abagyan, Diana, et al.
Published: (2025)
by: Abagyan, Diana, et al.
Published: (2025)
Low-Resource Languages Jailbreak GPT-4
by: Yong, Zheng-Xin, et al.
Published: (2023)
by: Yong, Zheng-Xin, et al.
Published: (2023)
SimMerge: Learning to Select Merge Operators from Similarity Signals
by: Bolton, Oliver, et al.
Published: (2026)
by: Bolton, Oliver, et al.
Published: (2026)
Diversify and Conquer: Diversity-Centric Data Selection with Iterative Refinement
by: Yu, Simon, et al.
Published: (2024)
by: Yu, Simon, et al.
Published: (2024)
Verification Limits Code LLM Training
by: Gureja, Srishti, et al.
Published: (2025)
by: Gureja, Srishti, et al.
Published: (2025)
Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
Unlocking Reasoning Capability on Machine Translation in Large Language Models
by: Rajaee, Sara, et al.
Published: (2026)
by: Rajaee, Sara, et al.
Published: (2026)
Aya 23: Open Weight Releases to Further Multilingual Progress
by: Aryabumi, Viraat, et al.
Published: (2024)
by: Aryabumi, Viraat, et al.
Published: (2024)
Aya Vision: Advancing the Frontier of Multilingual Multimodality
by: Dash, Saurabh, et al.
Published: (2025)
by: Dash, Saurabh, et al.
Published: (2025)
Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture
by: Song, Jiayang, et al.
Published: (2024)
by: Song, Jiayang, et al.
Published: (2024)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
by: Dang, John, et al.
Published: (2024)
by: Dang, John, et al.
Published: (2024)
The Leaderboard Illusion
by: Singh, Shivalika, et al.
Published: (2025)
by: Singh, Shivalika, et al.
Published: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
by: Zhao, Weixiang, et al.
Published: (2025)
by: Zhao, Weixiang, et al.
Published: (2025)
Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps
by: Chua, Gabriel, et al.
Published: (2025)
by: Chua, Gabriel, et al.
Published: (2025)
Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models
by: Chan, Yik Siu, et al.
Published: (2025)
by: Chan, Yik Siu, et al.
Published: (2025)
Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier
by: Dang, John, et al.
Published: (2024)
by: Dang, John, et al.
Published: (2024)
When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
by: Khairi, Ammar, et al.
Published: (2025)
by: Khairi, Ammar, et al.
Published: (2025)
Multilingual Hallucination Gaps in Large Language Models
by: Chataigner, Cléa, et al.
Published: (2024)
by: Chataigner, Cléa, et al.
Published: (2024)
All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
by: Wang, Dan, et al.
Published: (2026)
by: Wang, Dan, et al.
Published: (2026)
Improving the OOD Performance of Closed-Source LLMs on NLI Through Strategic Data Selection
by: Stacey, Joe, et al.
Published: (2025)
by: Stacey, Joe, et al.
Published: (2025)
From Tools to Teammates: Evaluating LLMs in Multi-Session Coding Interactions
by: Rakotonirina, Nathanaël Carraz, et al.
Published: (2025)
by: Rakotonirina, Nathanaël Carraz, et al.
Published: (2025)
From Fact to Judgment: Investigating the Impact of Task Framing on LLM Conviction in Dialogue Systems
by: Rabbani, Parisa, et al.
Published: (2025)
by: Rabbani, Parisa, et al.
Published: (2025)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
by: Gureja, Srishti, et al.
Published: (2024)
by: Gureja, Srishti, et al.
Published: (2024)
Similar Items
-
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
by: Aakanksha, et al.
Published: (2024) -
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
by: Kreutzer, Julia, et al.
Published: (2025) -
The Multilingual Divide and Its Impact on Global AI Safety
by: Peppin, Aidan, et al.
Published: (2025) -
The Art of Asking: Multilingual Prompt Optimization for Synthetic Data
by: Mora, David, et al.
Published: (2025) -
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
by: Shimabucoro, Luísa, et al.
Published: (2024)