Assessing Adversarial Robustness of Large Language Models: An Empirical Study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Zeyu, Meng, Zhao, Zheng, Xiaochen, Wattenhofer, Roger |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tiny Transformers Excel at Sentence Compression
par: Belcak, Peter, et autres
Publié: (2024)
par: Belcak, Peter, et autres
Publié: (2024)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks
par: Lin, Fangru, et autres
Publié: (2024)
par: Lin, Fangru, et autres
Publié: (2024)
An Empirical Study of Mamba-based Language Models
par: Waleffe, Roger, et autres
Publié: (2024)
par: Waleffe, Roger, et autres
Publié: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models
par: Luo, Hanrui, et autres
Publié: (2026)
par: Luo, Hanrui, et autres
Publié: (2026)
Reasoning Boosts Opinion Alignment in LLMs
par: Berdoz, Frédéric, et autres
Publié: (2026)
par: Berdoz, Frédéric, et autres
Publié: (2026)
Adversarial Moment-Matching Distillation of Large Language Models
par: Jia, Chen
Publié: (2024)
par: Jia, Chen
Publié: (2024)
Robust and Scalable Model Editing for Large Language Models
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
On Adversarial Robustness of Language Models in Transfer Learning
par: Turbal, Bohdan, et autres
Publié: (2024)
par: Turbal, Bohdan, et autres
Publié: (2024)
Adversarial Evasion Attack Efficiency against Large Language Models
par: Vitorino, João, et autres
Publié: (2024)
par: Vitorino, João, et autres
Publié: (2024)
Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
What Large Language Models Do Not Talk About: An Empirical Study of Moderation and Censorship Practices
par: Noels, Sander, et autres
Publié: (2025)
par: Noels, Sander, et autres
Publié: (2025)
EuroSpeech: A Multilingual Speech Corpus
par: Pfisterer, Samuel, et autres
Publié: (2025)
par: Pfisterer, Samuel, et autres
Publié: (2025)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
par: Li, Qizhang, et autres
Publié: (2024)
par: Li, Qizhang, et autres
Publié: (2024)
Measuring Non-Adversarial Reproduction of Training Data in Large Language Models
par: Aerni, Michael, et autres
Publié: (2024)
par: Aerni, Michael, et autres
Publié: (2024)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
par: Mu, Yongyu, et autres
Publié: (2025)
par: Mu, Yongyu, et autres
Publié: (2025)
Model Hemorrhage and the Robustness Limits of Large Language Models
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
A Closer Look into Mixture-of-Experts in Large Language Models
par: Lo, Ka Man, et autres
Publié: (2024)
par: Lo, Ka Man, et autres
Publié: (2024)
MoreauPruner: Robust Pruning of Large Language Models against Weight Perturbations
par: Wang, Zixiao, et autres
Publié: (2024)
par: Wang, Zixiao, et autres
Publié: (2024)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
par: Lee, Kunil, et autres
Publié: (2026)
par: Lee, Kunil, et autres
Publié: (2026)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
par: Abouzahir, Chaimae, et autres
Publié: (2026)
par: Abouzahir, Chaimae, et autres
Publié: (2026)
EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
par: Fang, Sen, et autres
Publié: (2025)
par: Fang, Sen, et autres
Publié: (2025)
DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models
par: Thorat, Shantanu, et autres
Publié: (2025)
par: Thorat, Shantanu, et autres
Publié: (2025)
Empirical Analysis of Efficient Fine-Tuning Methods for Large Pre-Trained Language Models
par: Doering, Nigel, et autres
Publié: (2024)
par: Doering, Nigel, et autres
Publié: (2024)
WorldSpeech: A Multilingual Speech Corpus from Around the World
par: Asonitis, Antonis, et autres
Publié: (2026)
par: Asonitis, Antonis, et autres
Publié: (2026)
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models
par: Liang, Hao, et autres
Publié: (2026)
par: Liang, Hao, et autres
Publié: (2026)
Assessing Factual Music Comprehension in Large Audio Language Models
par: Lin, Daniel Chenyu, et autres
Publié: (2025)
par: Lin, Daniel Chenyu, et autres
Publié: (2025)
Distilling Large Language Models for Text-Attributed Graph Learning
par: Pan, Bo, et autres
Publié: (2024)
par: Pan, Bo, et autres
Publié: (2024)
SORSA: Singular Values and Orthonormal Regularized Singular Vectors Adaptation of Large Language Models
par: Cao, Yang, et autres
Publié: (2024)
par: Cao, Yang, et autres
Publié: (2024)
Assessing Large Language Models on Climate Information
par: Bulian, Jannis, et autres
Publié: (2023)
par: Bulian, Jannis, et autres
Publié: (2023)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
par: Zhao, Siyan, et autres
Publié: (2025)
par: Zhao, Siyan, et autres
Publié: (2025)
Optimizing Large Language Models with an Enhanced LoRA Fine-Tuning Algorithm for Efficiency and Robustness in NLP Tasks
par: Hu, Jiacheng, et autres
Publié: (2024)
par: Hu, Jiacheng, et autres
Publié: (2024)
Layer by Layer: Uncovering Where Multi-Task Learning Happens in Instruction-Tuned Large Language Models
par: Zhao, Zheng, et autres
Publié: (2024)
par: Zhao, Zheng, et autres
Publié: (2024)
Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
par: Visser, Ruan, et autres
Publié: (2026)
par: Visser, Ruan, et autres
Publié: (2026)
A Survey of On-Policy Distillation for Large Language Models
par: Song, Mingyang, et autres
Publié: (2026)
par: Song, Mingyang, et autres
Publié: (2026)
On Large Language Models' Hallucination with Regard to Known Facts
par: Jiang, Che, et autres
Publié: (2024)
par: Jiang, Che, et autres
Publié: (2024)
ColaCare: Enhancing Electronic Health Record Modeling through Large Language Model-Driven Multi-Agent Collaboration
par: Wang, Zixiang, et autres
Publié: (2024)
par: Wang, Zixiang, et autres
Publié: (2024)
Prompting Fairness: Integrating Causality to Debias Large Language Models
par: Li, Jingling, et autres
Publié: (2024)
par: Li, Jingling, et autres
Publié: (2024)
Adversarial Reinforcement Learning for Large Language Model Agent Safety
par: Wang, Zizhao, et autres
Publié: (2025)
par: Wang, Zizhao, et autres
Publié: (2025)
Documents similaires
-
Tiny Transformers Excel at Sentence Compression
par: Belcak, Peter, et autres
Publié: (2024) -
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024) -
Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks
par: Lin, Fangru, et autres
Publié: (2024) -
An Empirical Study of Mamba-based Language Models
par: Waleffe, Roger, et autres
Publié: (2024) -
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)