On Adversarial Robustness and Out-of-Distribution Robustness of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, April, Tab, Jordan, Shah, Parth, Kotchavong, Paul |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
par: Huang, Jing, et autres
Publié: (2025)
par: Huang, Jing, et autres
Publié: (2025)
Adversarial Style Augmentation via Large Language Model for Robust Fake News Detection
par: Park, Sungwon, et autres
Publié: (2024)
par: Park, Sungwon, et autres
Publié: (2024)
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
par: Li, Moxin, et autres
Publié: (2023)
par: Li, Moxin, et autres
Publié: (2023)
Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation
par: Cantini, Riccardo, et autres
Publié: (2024)
par: Cantini, Riccardo, et autres
Publié: (2024)
Defensive Dual Masking for Robust Adversarial Defense
par: Yang, Wangli, et autres
Publié: (2024)
par: Yang, Wangli, et autres
Publié: (2024)
Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox
par: Zolfaghari, Vahideh
Publié: (2025)
par: Zolfaghari, Vahideh
Publié: (2025)
Benchmarking Adversarial Robustness to Bias Elicitation in Large Language Models: Scalable Automated Assessment with LLM-as-a-Judge
par: Cantini, Riccardo, et autres
Publié: (2025)
par: Cantini, Riccardo, et autres
Publié: (2025)
Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
par: Mu, Lin, et autres
Publié: (2025)
par: Mu, Lin, et autres
Publié: (2025)
Evaluating the Retrieval Robustness of Large Language Models
par: Cao, Shuyang, et autres
Publié: (2025)
par: Cao, Shuyang, et autres
Publié: (2025)
The Unequal Opportunities of Large Language Models: Revealing Demographic Bias through Job Recommendations
par: Salinas, Abel, et autres
Publié: (2023)
par: Salinas, Abel, et autres
Publié: (2023)
Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III
par: Shetty, Pranam, et autres
Publié: (2025)
par: Shetty, Pranam, et autres
Publié: (2025)
Unpacking Robustness in Inflectional Languages: Adversarial Evaluation and Mechanistic Insights
par: Walkowiak, Paweł, et autres
Publié: (2025)
par: Walkowiak, Paweł, et autres
Publié: (2025)
Test-Time Fairness and Robustness in Large Language Models
par: Cotta, Leonardo, et autres
Publié: (2024)
par: Cotta, Leonardo, et autres
Publié: (2024)
Probing the Robustness of Theory of Mind in Large Language Models
par: Nickel, Christian, et autres
Publié: (2024)
par: Nickel, Christian, et autres
Publié: (2024)
Investigating the Robustness of Deductive Reasoning with Large Language Models
par: Hoppe, Fabian, et autres
Publié: (2025)
par: Hoppe, Fabian, et autres
Publié: (2025)
Measuring Representation Robustness in Large Language Models for Geometry
par: Jawandhia, Vedant, et autres
Publié: (2026)
par: Jawandhia, Vedant, et autres
Publié: (2026)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
RobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy Response
par: Luo, Junyu, et autres
Publié: (2024)
par: Luo, Junyu, et autres
Publié: (2024)
Advancing the Robustness of Large Language Models through Self-Denoised Smoothing
par: Ji, Jiabao, et autres
Publié: (2024)
par: Ji, Jiabao, et autres
Publié: (2024)
Robust Neural Information Retrieval: An Adversarial and Out-of-distribution Perspective
par: Liu, Yu-An, et autres
Publié: (2024)
par: Liu, Yu-An, et autres
Publié: (2024)
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
par: Zhu, Zihao, et autres
Publié: (2025)
par: Zhu, Zihao, et autres
Publié: (2025)
Towards Robust Instruction Tuning on Multimodal Large Language Models
par: Han, Wei, et autres
Publié: (2024)
par: Han, Wei, et autres
Publié: (2024)
An Information-Theoretic Framework for Robust Large Language Model Editing
par: Chen, Qizhou, et autres
Publié: (2025)
par: Chen, Qizhou, et autres
Publié: (2025)
On Adversarial Robustness of Language Models in Transfer Learning
par: Turbal, Bohdan, et autres
Publié: (2024)
par: Turbal, Bohdan, et autres
Publié: (2024)
Are AI-Generated Text Detectors Robust to Adversarial Perturbations?
par: Huang, Guanhua, et autres
Publié: (2024)
par: Huang, Guanhua, et autres
Publié: (2024)
KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
par: Pei, Aihua, et autres
Publié: (2024)
par: Pei, Aihua, et autres
Publié: (2024)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
par: Wang, Hongbo, et autres
Publié: (2025)
par: Wang, Hongbo, et autres
Publié: (2025)
Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
par: Bao, Qiming, et autres
Publié: (2023)
par: Bao, Qiming, et autres
Publié: (2023)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Evaluating Large Language Models for Generalization and Robustness via Data Compression
par: Li, Yucheng, et autres
Publié: (2024)
par: Li, Yucheng, et autres
Publié: (2024)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
par: Jung, Dahyun, et autres
Publié: (2025)
par: Jung, Dahyun, et autres
Publié: (2025)
WellDunn: On the Robustness and Explainability of Language Models and Large Language Models in Identifying Wellness Dimensions
par: Mohammadi, Seyedali, et autres
Publié: (2024)
par: Mohammadi, Seyedali, et autres
Publié: (2024)
Are All Prompt Components Value-Neutral? Understanding the Heterogeneous Adversarial Robustness of Dissected Prompt in Large Language Models
par: Zheng, Yujia, et autres
Publié: (2025)
par: Zheng, Yujia, et autres
Publié: (2025)
Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
par: Galisai, Marcello, et autres
Publié: (2026)
par: Galisai, Marcello, et autres
Publié: (2026)
Reasoning Robustness of LLMs to Adversarial Typographical Errors
par: Gan, Esther, et autres
Publié: (2024)
par: Gan, Esther, et autres
Publié: (2024)
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
par: Paul, Indraneil, et autres
Publié: (2024)
par: Paul, Indraneil, et autres
Publié: (2024)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
par: Nguyen, Son The, et autres
Publié: (2024)
par: Nguyen, Son The, et autres
Publié: (2024)
UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models
par: Dong, Yijiang River, et autres
Publié: (2024)
par: Dong, Yijiang River, et autres
Publié: (2024)
Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
par: Zhang, Kun, et autres
Publié: (2025)
par: Zhang, Kun, et autres
Publié: (2025)
Documents similaires
-
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
par: Huang, Jing, et autres
Publié: (2025) -
Adversarial Style Augmentation via Large Language Model for Robust Fake News Detection
par: Park, Sungwon, et autres
Publié: (2024) -
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
par: Li, Moxin, et autres
Publié: (2023) -
Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation
par: Cantini, Riccardo, et autres
Publié: (2024) -
Defensive Dual Masking for Robust Adversarial Defense
par: Yang, Wangli, et autres
Publié: (2024)