Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bu, Yuyan, Liu, Xiaohao, Ren, ZhaoXing, Yang, Yaodong, Dai, Juntao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026)
par: Qin, Ruiyang, et autres
Publié: (2026)
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
par: Aakanksha, et autres
Publié: (2024)
par: Aakanksha, et autres
Publié: (2024)
Aligner: Efficient Alignment by Learning to Correct
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Towards Multilingual LLM Evaluation for European Languages
par: Thellmann, Klaudia, et autres
Publié: (2024)
par: Thellmann, Klaudia, et autres
Publié: (2024)
Multilingual Instruction Tuning With Just a Pinch of Multilinguality
par: Shaham, Uri, et autres
Publié: (2024)
par: Shaham, Uri, et autres
Publié: (2024)
Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
Multilingual Routing in Mixture-of-Experts
par: Bandarkar, Lucas, et autres
Publié: (2025)
par: Bandarkar, Lucas, et autres
Publié: (2025)
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
par: Banerjee, Somnath, et autres
Publié: (2025)
par: Banerjee, Somnath, et autres
Publié: (2025)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
par: Kurz, Simon, et autres
Publié: (2024)
par: Kurz, Simon, et autres
Publié: (2024)
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
par: Dai, Hui, et autres
Publié: (2026)
par: Dai, Hui, et autres
Publié: (2026)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Cross-Lingual Consistency of Factual Knowledge in Multilingual Language Models
par: Qi, Jirui, et autres
Publié: (2023)
par: Qi, Jirui, et autres
Publié: (2023)
PMMT: Preference Alignment in Multilingual Machine Translation via LLM Distillation
par: Sun, Shuqiao, et autres
Publié: (2024)
par: Sun, Shuqiao, et autres
Publié: (2024)
M2Lingual: Enhancing Multilingual, Multi-Turn Instruction Alignment in Large Language Models
par: Maheshwary, Rishabh, et autres
Publié: (2024)
par: Maheshwary, Rishabh, et autres
Publié: (2024)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
par: Wang, Lichao, et autres
Publié: (2026)
par: Wang, Lichao, et autres
Publié: (2026)
Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation
par: Alam, Firoj, et autres
Publié: (2026)
par: Alam, Firoj, et autres
Publié: (2026)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
Medical mT5: An Open-Source Multilingual Text-to-Text LLM for The Medical Domain
par: García-Ferrero, Iker, et autres
Publié: (2024)
par: García-Ferrero, Iker, et autres
Publié: (2024)
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
par: Jia, Feiran, et autres
Publié: (2024)
par: Jia, Feiran, et autres
Publié: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
par: Yang, Junxiao, et autres
Publié: (2026)
par: Yang, Junxiao, et autres
Publié: (2026)
Tagengo: A Multilingual Chat Dataset
par: Devine, Peter
Publié: (2024)
par: Devine, Peter
Publié: (2024)
Do Multilingual LLMs Think In English?
par: Schut, Lisa, et autres
Publié: (2025)
par: Schut, Lisa, et autres
Publié: (2025)
IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia
par: Pattnayak, Priyaranjan, et autres
Publié: (2026)
par: Pattnayak, Priyaranjan, et autres
Publié: (2026)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
par: Bai, Fengshuo, et autres
Publié: (2024)
par: Bai, Fengshuo, et autres
Publié: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
par: Sundar, Anirudh, et autres
Publié: (2025)
par: Sundar, Anirudh, et autres
Publié: (2025)
TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment
par: Nguyen, Thi-Nhung, et autres
Publié: (2026)
par: Nguyen, Thi-Nhung, et autres
Publié: (2026)
Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning
par: Zhang, Zhaowei, et autres
Publié: (2026)
par: Zhang, Zhaowei, et autres
Publié: (2026)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024)
par: Zhou, Jiayi, et autres
Publié: (2024)
On the Consistency of Multilingual Context Utilization in Retrieval-Augmented Generation
par: Qi, Jirui, et autres
Publié: (2025)
par: Qi, Jirui, et autres
Publié: (2025)
Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMs
par: Dou, Longxu, et autres
Publié: (2025)
par: Dou, Longxu, et autres
Publié: (2025)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
par: Li, Daoyang, et autres
Publié: (2024)
par: Li, Daoyang, et autres
Publié: (2024)
Improving Multilingual Instruction Finetuning via Linguistically Natural and Diverse Datasets
par: Indurthi, Sathish Reddy, et autres
Publié: (2024)
par: Indurthi, Sathish Reddy, et autres
Publié: (2024)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025)
par: Rystrøm, Jonathan, et autres
Publié: (2025)
CORAL: Adaptive Retrieval Loop for Culturally-Aligned Multilingual RAG
par: Lee, Nayeon, et autres
Publié: (2026)
par: Lee, Nayeon, et autres
Publié: (2026)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
par: Dai, Juntao, et autres
Publié: (2024)
par: Dai, Juntao, et autres
Publié: (2024)
Documents similaires
-
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026) -
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
par: Aakanksha, et autres
Publié: (2024) -
Aligner: Efficient Alignment by Learning to Correct
par: Ji, Jiaming, et autres
Publié: (2024) -
Towards Multilingual LLM Evaluation for European Languages
par: Thellmann, Klaudia, et autres
Publié: (2024) -
Multilingual Instruction Tuning With Just a Pinch of Multilinguality
par: Shaham, Uri, et autres
Publié: (2024)