The Multilingual Divide and Its Impact on Global AI Safety
Fuente:
arXiv
Saved in:
| Main Authors: | Peppin, Aidan, Kreutzer, Julia, Sebag, Alice Schoenauer, Marchisio, Kelly, Ermis, Beyza, Dang, John, Cahyawijaya, Samuel, Singh, Shivalika, Goldfarb-Tarrant, Seraphina, Aryabumi, Viraat, Aakanksha, Ko, Wei-Yin, Üstün, Ahmet, Gallé, Matthias, Fadaee, Marzieh, Hooker, Sara |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
by: Aakanksha, et al.
Published: (2024)
by: Aakanksha, et al.
Published: (2024)
Mix Data or Merge Models? Optimizing for Diverse Multi-Task Learning
by: Aakanksha, et al.
Published: (2024)
by: Aakanksha, et al.
Published: (2024)
The Art of Asking: Multilingual Prompt Optimization for Synthetic Data
by: Mora, David, et al.
Published: (2025)
by: Mora, David, et al.
Published: (2025)
SimMerge: Learning to Select Merge Operators from Similarity Signals
by: Bolton, Oliver, et al.
Published: (2026)
by: Bolton, Oliver, et al.
Published: (2026)
To Code, or Not To Code? Exploring Impact of Code in Pre-training
by: Aryabumi, Viraat, et al.
Published: (2024)
by: Aryabumi, Viraat, et al.
Published: (2024)
The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It
by: Yong, Zheng-Xin, et al.
Published: (2025)
by: Yong, Zheng-Xin, et al.
Published: (2025)
Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
by: Ahmadian, Arash, et al.
Published: (2024)
by: Ahmadian, Arash, et al.
Published: (2024)
Aya Model: An Instruction Finetuned Open-Access Multilingual Language Model
by: Üstün, Ahmet, et al.
Published: (2024)
by: Üstün, Ahmet, et al.
Published: (2024)
Aya Vision: Advancing the Frontier of Multilingual Multimodality
by: Dash, Saurabh, et al.
Published: (2025)
by: Dash, Saurabh, et al.
Published: (2025)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
by: Dang, John, et al.
Published: (2024)
by: Dang, John, et al.
Published: (2024)
A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics
by: Shimabucoro, Luisa, et al.
Published: (2025)
by: Shimabucoro, Luisa, et al.
Published: (2025)
Aya 23: Open Weight Releases to Further Multilingual Progress
by: Aryabumi, Viraat, et al.
Published: (2024)
by: Aryabumi, Viraat, et al.
Published: (2024)
Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts
by: Chen, Hongyu, et al.
Published: (2025)
by: Chen, Hongyu, et al.
Published: (2025)
Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
by: Seshadri, Preethi, et al.
Published: (2026)
by: Seshadri, Preethi, et al.
Published: (2026)
Tiny Aya: Bridging Scale and Multilingual Depth
by: Salamanca, Alejandro R., et al.
Published: (2026)
by: Salamanca, Alejandro R., et al.
Published: (2026)
The Leaderboard Illusion
by: Singh, Shivalika, et al.
Published: (2025)
by: Singh, Shivalika, et al.
Published: (2025)
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
by: Shimabucoro, Luísa, et al.
Published: (2024)
by: Shimabucoro, Luísa, et al.
Published: (2024)
How Does Quantization Affect Multilingual LLMs?
by: Marchisio, Kelly, et al.
Published: (2024)
by: Marchisio, Kelly, et al.
Published: (2024)
Multilingual Arbitrage: Optimizing Data Pools to Accelerate Multilingual Progress
by: Odumakinde, Ayomide, et al.
Published: (2024)
by: Odumakinde, Ayomide, et al.
Published: (2024)
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
by: Kreutzer, Julia, et al.
Published: (2025)
by: Kreutzer, Julia, et al.
Published: (2025)
Verification Limits Code LLM Training
by: Gureja, Srishti, et al.
Published: (2025)
by: Gureja, Srishti, et al.
Published: (2025)
MAPS: A Multilingual Benchmark for Agent Performance and Security
by: Hofman, Omer, et al.
Published: (2025)
by: Hofman, Omer, et al.
Published: (2025)
One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual Tokenizers
by: Abagyan, Diana, et al.
Published: (2025)
by: Abagyan, Diana, et al.
Published: (2025)
Small Changes, Large Consequences: Analyzing the Allocational Fairness of LLMs in Hiring Contexts
by: Seshadri, Preethi, et al.
Published: (2025)
by: Seshadri, Preethi, et al.
Published: (2025)
Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier
by: Dang, John, et al.
Published: (2024)
by: Dang, John, et al.
Published: (2024)
Treasure Hunt: Real-time Targeting of the Long Tail using Training-Time Markers
by: D'souza, Daniel, et al.
Published: (2025)
by: D'souza, Daniel, et al.
Published: (2025)
Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them
by: Rajani, Neel, et al.
Published: (2025)
by: Rajani, Neel, et al.
Published: (2025)
MultiContrievers: Analysis of Dense Retrieval Representations
by: Goldfarb-Tarrant, Seraphina, et al.
Published: (2024)
by: Goldfarb-Tarrant, Seraphina, et al.
Published: (2024)
From One to Many: Expanding the Scope of Toxicity Mitigation in Language Models
by: Pozzobon, Luiza, et al.
Published: (2024)
by: Pozzobon, Luiza, et al.
Published: (2024)
Automatic WordNet Construction Using Markov Chain Monte Carlo
by: Marzieh Fadaee
Published: (2013)
by: Marzieh Fadaee
Published: (2013)
Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
Making, not Taking, the Best of N
by: Khairi, Ammar, et al.
Published: (2025)
by: Khairi, Ammar, et al.
Published: (2025)
Unlocking Reasoning Capability on Machine Translation in Large Language Models
by: Rajaee, Sara, et al.
Published: (2026)
by: Rajaee, Sara, et al.
Published: (2026)
Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
by: Engländer, Leon, et al.
Published: (2026)
by: Engländer, Leon, et al.
Published: (2026)
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
by: Orgad, Hadas, et al.
Published: (2026)
by: Orgad, Hadas, et al.
Published: (2026)
Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
NeoBabel: A Multilingual Open Tower for Visual Generation
by: Derakhshani, Mohammad Mahdi, et al.
Published: (2025)
by: Derakhshani, Mohammad Mahdi, et al.
Published: (2025)
A SMART Mnemonic Sounds like "Glue Tonic": Mixing LLMs with Student Feedback to Make Mnemonic Learning Stick
by: Balepur, Nishant, et al.
Published: (2024)
by: Balepur, Nishant, et al.
Published: (2024)
The Disparate Impacts of Speculative Decoding
by: Sandler, Jameson, et al.
Published: (2025)
by: Sandler, Jameson, et al.
Published: (2025)
Nexus: Specialization meets Adaptability for Efficiently Training Mixture of Experts
by: Gritsch, Nikolas, et al.
Published: (2024)
by: Gritsch, Nikolas, et al.
Published: (2024)
Similar Items
-
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
by: Aakanksha, et al.
Published: (2024) -
Mix Data or Merge Models? Optimizing for Diverse Multi-Task Learning
by: Aakanksha, et al.
Published: (2024) -
The Art of Asking: Multilingual Prompt Optimization for Synthetic Data
by: Mora, David, et al.
Published: (2025) -
SimMerge: Learning to Select Merge Operators from Similarity Signals
by: Bolton, Oliver, et al.
Published: (2026) -
To Code, or Not To Code? Exploring Impact of Code in Pre-training
by: Aryabumi, Viraat, et al.
Published: (2024)