Towards the Worst-case Robustness of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Huanran, Dong, Yinpeng, Wei, Zeming, Su, Hang, Zhu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unveiling the Basin-Like Loss Landscape in Large Language Models
di: Chen, Huanran, et al.
Pubblicazione: (2025)
di: Chen, Huanran, et al.
Pubblicazione: (2025)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
di: Chen, Huanran, et al.
Pubblicazione: (2024)
di: Chen, Huanran, et al.
Pubblicazione: (2024)
Robust Classification via a Single Diffusion Model
di: Chen, Huanran, et al.
Pubblicazione: (2023)
di: Chen, Huanran, et al.
Pubblicazione: (2023)
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
Alignment Dynamics in LLM Fine-Tuning
di: Huang, Yuhan, et al.
Pubblicazione: (2026)
di: Huang, Yuhan, et al.
Pubblicazione: (2026)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
Scaling Laws for Black box Adversarial Attacks
di: Liu, Chuan, et al.
Pubblicazione: (2024)
di: Liu, Chuan, et al.
Pubblicazione: (2024)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima
di: Chen, Huanran, et al.
Pubblicazione: (2026)
di: Chen, Huanran, et al.
Pubblicazione: (2026)
Decoding Large Language Diffusion Models with Foreseeing Movement
di: Mo, Yichuan, et al.
Pubblicazione: (2025)
di: Mo, Yichuan, et al.
Pubblicazione: (2025)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Diffusion Models as Dataset Distillation Priors
di: Su, Duo, et al.
Pubblicazione: (2025)
di: Su, Duo, et al.
Pubblicazione: (2025)
Adversarial Training for Robust Coverage Network under Worst-case Facility Losses
di: Miao, Changhao, et al.
Pubblicazione: (2026)
di: Miao, Changhao, et al.
Pubblicazione: (2026)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
di: Chen, Huanran, et al.
Pubblicazione: (2023)
di: Chen, Huanran, et al.
Pubblicazione: (2023)
MLP Fusion: Towards Efficient Fine-tuning of Dense and Mixture-of-Experts Language Models
di: Ai, Mengting, et al.
Pubblicazione: (2023)
di: Ai, Mengting, et al.
Pubblicazione: (2023)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Why the Maximum Second Derivative of Activations Matters for Adversarial Robustness
di: Yu, Yunrui, et al.
Pubblicazione: (2026)
di: Yu, Yunrui, et al.
Pubblicazione: (2026)
Worst-case generation via minimax optimization in Wasserstein space
di: Cheng, Xiuyuan, et al.
Pubblicazione: (2025)
di: Cheng, Xiuyuan, et al.
Pubblicazione: (2025)
Real-world Adversarial Defense against Patch Attacks based on Diffusion Model
di: Wei, Xingxing, et al.
Pubblicazione: (2024)
di: Wei, Xingxing, et al.
Pubblicazione: (2024)
Evaluating Model Performance Under Worst-case Subpopulations
di: Li, Mike, et al.
Pubblicazione: (2024)
di: Li, Mike, et al.
Pubblicazione: (2024)
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
di: Ying, Chengyang, et al.
Pubblicazione: (2022)
di: Ying, Chengyang, et al.
Pubblicazione: (2022)
Beyond Worst-case Attacks: Robust RL with Adaptive Defense via Non-dominated Policies
di: Liu, Xiangyu, et al.
Pubblicazione: (2024)
di: Liu, Xiangyu, et al.
Pubblicazione: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
Improving Full Waveform Inversion in Large Model Era
di: Feng, Yinan, et al.
Pubblicazione: (2026)
di: Feng, Yinan, et al.
Pubblicazione: (2026)
Toward Availability Attacks in 3D Point Clouds
di: Zhu, Yifan, et al.
Pubblicazione: (2024)
di: Zhu, Yifan, et al.
Pubblicazione: (2024)
Worst-case low-rank approximations
di: Fries, Anya, et al.
Pubblicazione: (2026)
di: Fries, Anya, et al.
Pubblicazione: (2026)
Noise Contrastive Alignment of Language Models with Explicit Rewards
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
Towards a General Framework for Continual Learning with Pre-training
di: Wang, Liyuan, et al.
Pubblicazione: (2023)
di: Wang, Liyuan, et al.
Pubblicazione: (2023)
Towards Multimodal Graph Large Language Model
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
Towards Versatile Graph Learning Approach: from the Perspective of Large Language Models
di: Wei, Lanning, et al.
Pubblicazione: (2024)
di: Wei, Lanning, et al.
Pubblicazione: (2024)
DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks
di: Kang, Caixin, et al.
Pubblicazione: (2023)
di: Kang, Caixin, et al.
Pubblicazione: (2023)
A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models
di: Cai, Yinpeng, et al.
Pubblicazione: (2025)
di: Cai, Yinpeng, et al.
Pubblicazione: (2025)
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
di: Cui, Peng, et al.
Pubblicazione: (2024)
di: Cui, Peng, et al.
Pubblicazione: (2024)
R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability
di: Lu, Runyu, et al.
Pubblicazione: (2025)
di: Lu, Runyu, et al.
Pubblicazione: (2025)
Bridging Large Language Models and Graph Structure Learning Models for Robust Representation Learning
di: Su, Guangxin, et al.
Pubblicazione: (2024)
di: Su, Guangxin, et al.
Pubblicazione: (2024)
Automata-Based Steering of Large Language Models for Diverse Structured Generation
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
di: Luan, Xiaokun, et al.
Pubblicazione: (2025)
Towards Generation-Efficient Uncertainty Estimation in Large Language Models
di: Zhu, Mingcheng, et al.
Pubblicazione: (2026)
di: Zhu, Mingcheng, et al.
Pubblicazione: (2026)
Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment
di: Chen, Huayu, et al.
Pubblicazione: (2024)
di: Chen, Huayu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Unveiling the Basin-Like Loss Landscape in Large Language Models
di: Chen, Huanran, et al.
Pubblicazione: (2025) -
Your Diffusion Model is Secretly a Certifiably Robust Classifier
di: Chen, Huanran, et al.
Pubblicazione: (2024) -
Robust Classification via a Single Diffusion Model
di: Chen, Huanran, et al.
Pubblicazione: (2023) -
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
di: Wu, Chengcan, et al.
Pubblicazione: (2025) -
Alignment Dynamics in LLM Fine-Tuning
di: Huang, Yuhan, et al.
Pubblicazione: (2026)