CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Zhenhong, Yan, Shilinlu, Liu, Chuanpu, Li, Qiankun, Wang, Kun, Zeng, Zhigang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
di: Wang, Kun, et al.
Pubblicazione: (2026)
di: Wang, Kun, et al.
Pubblicazione: (2026)
CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs
di: Chen, Sijia, et al.
Pubblicazione: (2025)
di: Chen, Sijia, et al.
Pubblicazione: (2025)
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
di: Cai, Yunna, et al.
Pubblicazione: (2025)
di: Cai, Yunna, et al.
Pubblicazione: (2025)
Safety Evaluation of DeepSeek Models in Chinese Contexts
di: Zhang, Wenjing, et al.
Pubblicazione: (2025)
di: Zhang, Wenjing, et al.
Pubblicazione: (2025)
ShiZhi: A Chinese Lightweight Large Language Model for Court View Generation
di: Hou, Zhitian, et al.
Pubblicazione: (2025)
di: Hou, Zhitian, et al.
Pubblicazione: (2025)
Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts
di: Zhang, Wenjing, et al.
Pubblicazione: (2025)
di: Zhang, Wenjing, et al.
Pubblicazione: (2025)
Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations
di: Sun, Jiaxing, et al.
Pubblicazione: (2024)
di: Sun, Jiaxing, et al.
Pubblicazione: (2024)
Fast Adversarial Training against Textual Adversarial Attacks
di: Yang, Yichen, et al.
Pubblicazione: (2024)
di: Yang, Yichen, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
di: Lin, Liang, et al.
Pubblicazione: (2026)
di: Lin, Liang, et al.
Pubblicazione: (2026)
Purple-teaming LLMs with Adversarial Defender Training
di: Zhou, Jingyan, et al.
Pubblicazione: (2024)
di: Zhou, Jingyan, et al.
Pubblicazione: (2024)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
di: Liu, Chuang, et al.
Pubblicazione: (2024)
di: Liu, Chuang, et al.
Pubblicazione: (2024)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
MINER: Mining the Underlying Pattern of Modality-Specific Neurons in Multimodal Large Language Models
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
di: Huang, Kaichen, et al.
Pubblicazione: (2024)
Goal-Aware Identification and Rectification of Misinformation in Multi-Agent Systems
di: Li, Zherui, et al.
Pubblicazione: (2025)
di: Li, Zherui, et al.
Pubblicazione: (2025)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
di: He, Chaoqun, et al.
Pubblicazione: (2024)
di: He, Chaoqun, et al.
Pubblicazione: (2024)
HearSay Benchmark: Do Audio LLMs Leak What They Hear?
di: Wang, Jin, et al.
Pubblicazione: (2026)
di: Wang, Jin, et al.
Pubblicazione: (2026)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
di: Li, Zherui, et al.
Pubblicazione: (2025)
di: Li, Zherui, et al.
Pubblicazione: (2025)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
Certifying LLM Safety against Adversarial Prompting
di: Kumar, Aounon, et al.
Pubblicazione: (2023)
di: Kumar, Aounon, et al.
Pubblicazione: (2023)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
di: Kong, Shufeng, et al.
Pubblicazione: (2025)
di: Kong, Shufeng, et al.
Pubblicazione: (2025)
Evaluating LLMs on Chinese Idiom Translation
di: Yang, Cai, et al.
Pubblicazione: (2025)
di: Yang, Cai, et al.
Pubblicazione: (2025)
On the Role of Attention Heads in Large Language Model Safety
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
di: Chen, Lu, et al.
Pubblicazione: (2024)
di: Chen, Lu, et al.
Pubblicazione: (2024)
MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
di: Kan, Chun Yan Ryan, et al.
Pubblicazione: (2026)
di: Kan, Chun Yan Ryan, et al.
Pubblicazione: (2026)
How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study
di: Sun, Moran, et al.
Pubblicazione: (2026)
di: Sun, Moran, et al.
Pubblicazione: (2026)
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
di: Gao, Lirong, et al.
Pubblicazione: (2026)
di: Gao, Lirong, et al.
Pubblicazione: (2026)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
di: Ilin, Aleksei, et al.
Pubblicazione: (2025)
di: Ilin, Aleksei, et al.
Pubblicazione: (2025)
Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
Unveiling the Competitive Dynamics: A Comparative Evaluation of American and Chinese LLMs
di: Jiang, Zhenhui, et al.
Pubblicazione: (2024)
di: Jiang, Zhenhui, et al.
Pubblicazione: (2024)
TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
di: Hu, Gang, et al.
Pubblicazione: (2026)
di: Hu, Gang, et al.
Pubblicazione: (2026)
Speculating LLMs' Chinese Training Data Pollution from Their Tokens
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
Gold Panning in Vocabulary: An Adaptive Method for Vocabulary Expansion of Domain-Specific LLMs
di: Liu, Chengyuan, et al.
Pubblicazione: (2024)
di: Liu, Chengyuan, et al.
Pubblicazione: (2024)
Flames: Benchmarking Value Alignment of LLMs in Chinese
di: Huang, Kexin, et al.
Pubblicazione: (2023)
di: Huang, Kexin, et al.
Pubblicazione: (2023)
SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
di: Lin, Jiacheng, et al.
Pubblicazione: (2025)
di: Lin, Jiacheng, et al.
Pubblicazione: (2025)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
di: Wu, Chengwei, et al.
Pubblicazione: (2025)
di: Wu, Chengwei, et al.
Pubblicazione: (2025)
Tracing Intricate Cues in Dialogue: Joint Graph Structure and Sentiment Dynamics for Multimodal Emotion Recognition
di: Li, Jiang, et al.
Pubblicazione: (2024)
di: Li, Jiang, et al.
Pubblicazione: (2024)
MIST: Towards Multi-dimensional Implicit BiaS Evaluation of LLMs for Theory of Mind
di: Li, Yanlin, et al.
Pubblicazione: (2025)
di: Li, Yanlin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
di: Wang, Kun, et al.
Pubblicazione: (2026) -
CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs
di: Chen, Sijia, et al.
Pubblicazione: (2025) -
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
di: Cai, Yunna, et al.
Pubblicazione: (2025) -
Safety Evaluation of DeepSeek Models in Chinese Contexts
di: Zhang, Wenjing, et al.
Pubblicazione: (2025) -
ShiZhi: A Chinese Lightweight Large Language Model for Court View Generation
di: Hou, Zhitian, et al.
Pubblicazione: (2025)