Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Jiayang, Huang, Yuheng, Zhou, Zhehua, Ma, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Online Safety Analysis for LLMs: a Benchmark, an Assessment, and a Path Forward
di: Xie, Xuan, et al.
Pubblicazione: (2024)
di: Xie, Xuan, et al.
Pubblicazione: (2024)
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
di: Sun, Ruoyu, et al.
Pubblicazione: (2025)
di: Sun, Ruoyu, et al.
Pubblicazione: (2025)
LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation
di: Wang, Zhijie, et al.
Pubblicazione: (2024)
di: Wang, Zhijie, et al.
Pubblicazione: (2024)
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
di: Wang, Zhijie, et al.
Pubblicazione: (2024)
di: Wang, Zhijie, et al.
Pubblicazione: (2024)
Evaluating LLMs on Sequential API Call Through Automated Test Generation
di: Huang, Yuheng, et al.
Pubblicazione: (2025)
di: Huang, Yuheng, et al.
Pubblicazione: (2025)
AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling
di: Huang, Yuheng, et al.
Pubblicazione: (2024)
di: Huang, Yuheng, et al.
Pubblicazione: (2024)
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models
di: Huang, Yuheng, et al.
Pubblicazione: (2023)
di: Huang, Yuheng, et al.
Pubblicazione: (2023)
LeCov: Multi-level Testing Criteria for Large Language Models
di: Xie, Xuan, et al.
Pubblicazione: (2024)
di: Xie, Xuan, et al.
Pubblicazione: (2024)
LUNA: A Model-Based Universal Analysis Framework for Large Language Models
di: Song, Da, et al.
Pubblicazione: (2023)
di: Song, Da, et al.
Pubblicazione: (2023)
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
di: Banerjee, Somnath, et al.
Pubblicazione: (2025)
Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages
di: Banerjee, Somnath, et al.
Pubblicazione: (2026)
di: Banerjee, Somnath, et al.
Pubblicazione: (2026)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Improving LLM Safety Alignment with Dual-Objective Optimization
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding
di: Yoo, Haneul, et al.
Pubblicazione: (2024)
di: Yoo, Haneul, et al.
Pubblicazione: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
di: Fan, Yuchun, et al.
Pubblicazione: (2025)
di: Fan, Yuchun, et al.
Pubblicazione: (2025)
Could Thinking Multilingually Empower LLM Reasoning?
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis
di: Song, Da, et al.
Pubblicazione: (2026)
di: Song, Da, et al.
Pubblicazione: (2026)
Multilingual Safety Alignment via Self-Distillation
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
GenSafe: A Generalizable Safety Enhancer for Safe Reinforcement Learning Algorithms Based on Reduced Order Markov Decision Process Model
di: Zhou, Zhehua, et al.
Pubblicazione: (2024)
di: Zhou, Zhehua, et al.
Pubblicazione: (2024)
EthioLLM: Multilingual Large Language Models for Ethiopian Languages with Task Evaluation
di: Tonja, Atnafu Lambebo, et al.
Pubblicazione: (2024)
di: Tonja, Atnafu Lambebo, et al.
Pubblicazione: (2024)
Language Model Alignment in Multilingual Trolley Problems
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
Evaluation and Improvement of Fault Detection for Large Language Models
di: Hu, Qiang, et al.
Pubblicazione: (2024)
di: Hu, Qiang, et al.
Pubblicazione: (2024)
Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies
di: Qiu, Haoyi, et al.
Pubblicazione: (2025)
di: Qiu, Haoyi, et al.
Pubblicazione: (2025)
AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment
di: Bu, Mengyu, et al.
Pubblicazione: (2025)
di: Bu, Mengyu, et al.
Pubblicazione: (2025)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
All Languages Matter: On the Multilingual Safety of Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
Towards Multilingual LLM Evaluation for European Languages
di: Thellmann, Klaudia, et al.
Pubblicazione: (2024)
di: Thellmann, Klaudia, et al.
Pubblicazione: (2024)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2024)
di: She, Shuaijie, et al.
Pubblicazione: (2024)
Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
di: Brito, Iago Alves, et al.
Pubblicazione: (2026)
di: Brito, Iago Alves, et al.
Pubblicazione: (2026)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
di: Rystrøm, Jonathan, et al.
Pubblicazione: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
di: Yang, Yahan, et al.
Pubblicazione: (2025)
di: Yang, Yahan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Online Safety Analysis for LLMs: a Benchmark, an Assessment, and a Path Forward
di: Xie, Xuan, et al.
Pubblicazione: (2024) -
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
di: Sun, Ruoyu, et al.
Pubblicazione: (2025) -
LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation
di: Wang, Zhijie, et al.
Pubblicazione: (2024) -
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
di: Wang, Zhijie, et al.
Pubblicazione: (2024) -
Evaluating LLMs on Sequential API Call Through Automated Test Generation
di: Huang, Yuheng, et al.
Pubblicazione: (2025)