All Languages Matter: On the Multilingual Safety of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenxuan, Tu, Zhaopeng, Chen, Chang, Yuan, Youliang, Huang, Jen-tse, Jiao, Wenxiang, Lyu, Michael R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
On the Shortcut Learning in Multilingual Neural Machine Translation
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
Towards Evaluating Proactive Risk Awareness of Multimodal Language Models
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
On the Failure of Latent State Persistence in Large Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
Understanding and Mitigating the Uncertainty in Zero-Shot Translation
di: Wang, Wenxuan, et al.
Pubblicazione: (2022)
di: Wang, Wenxuan, et al.
Pubblicazione: (2022)
GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher
di: Yuan, Youliang, et al.
Pubblicazione: (2023)
di: Yuan, Youliang, et al.
Pubblicazione: (2023)
Learning to Ask: When LLM Agents Meet Unclear Instruction
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Revisiting the Reliability of Psychological Scales on Large Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
How do Large Language Models Handle Multilingualism?
di: Zhao, Yiran, et al.
Pubblicazione: (2024)
di: Zhao, Yiran, et al.
Pubblicazione: (2024)
Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
Improving Machine Translation with Human Feedback: An Exploration of Quality Estimation as a Reward Model
di: He, Zhiwei, et al.
Pubblicazione: (2024)
di: He, Zhiwei, et al.
Pubblicazione: (2024)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
Multilingual Collaborative Defense for Large Language Models
di: Li, Hongliang, et al.
Pubblicazione: (2025)
di: Li, Hongliang, et al.
Pubblicazione: (2025)
RetrieveAll: A Multilingual Named Entity Recognition Framework with Large Language Models
di: Zhang, Jin, et al.
Pubblicazione: (2025)
di: Zhang, Jin, et al.
Pubblicazione: (2025)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
di: Lam, Man Ho, et al.
Pubblicazione: (2025)
di: Lam, Man Ho, et al.
Pubblicazione: (2025)
ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?
di: Li, Shuqing, et al.
Pubblicazione: (2025)
di: Li, Shuqing, et al.
Pubblicazione: (2025)
Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs
di: Huang, Jen-Tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-Tse, et al.
Pubblicazione: (2025)
Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark for Large Language Models
di: He, Zhiwei, et al.
Pubblicazione: (2024)
di: He, Zhiwei, et al.
Pubblicazione: (2024)
Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation
di: Huang, Jen-tse, et al.
Pubblicazione: (2026)
di: Huang, Jen-tse, et al.
Pubblicazione: (2026)
Babel: Open Multilingual Large Language Models Serving Over 90% of Global Speakers
di: Zhao, Yiran, et al.
Pubblicazione: (2025)
di: Zhao, Yiran, et al.
Pubblicazione: (2025)
The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts
di: Shen, Lingfeng, et al.
Pubblicazione: (2024)
di: Shen, Lingfeng, et al.
Pubblicazione: (2024)
NewTerm: Benchmarking Real-Time New Terms for Large Language Models with Annual Updates
di: Deng, Hexuan, et al.
Pubblicazione: (2024)
di: Deng, Hexuan, et al.
Pubblicazione: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
Pruning General Large Language Models into Customized Expert Models
di: Zhao, Yirao, et al.
Pubblicazione: (2025)
di: Zhao, Yirao, et al.
Pubblicazione: (2025)
Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?
di: Chen, Pinzhen, et al.
Pubblicazione: (2024)
di: Chen, Pinzhen, et al.
Pubblicazione: (2024)
Optimizing Language Augmentation for Multilingual Large Language Models: A Case Study on Korean
di: Choi, ChangSu, et al.
Pubblicazione: (2024)
di: Choi, ChangSu, et al.
Pubblicazione: (2024)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
di: Wang, Wenxuan
Pubblicazione: (2024)
di: Wang, Wenxuan
Pubblicazione: (2024)
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
di: Zhang, Yeqin, et al.
Pubblicazione: (2025)
di: Zhang, Yeqin, et al.
Pubblicazione: (2025)
The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models
di: Huang, Linghan, et al.
Pubblicazione: (2025)
di: Huang, Linghan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023) -
On the Shortcut Learning in Multilingual Neural Machine Translation
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024) -
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)