Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zhihao, Wu, Yifan, Lou, Jian, Wang, Di, Zhou, Yuxi, Hu, Yuke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer
por: Feng, Jian, et al.
Publicado: (2026)
por: Feng, Jian, et al.
Publicado: (2026)
Localized Zeroth-Order Prompt Optimization
por: Hu, Wenyang, et al.
Publicado: (2024)
por: Hu, Wenyang, et al.
Publicado: (2024)
Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint
por: Liu, Zhihao, et al.
Publicado: (2025)
por: Liu, Zhihao, et al.
Publicado: (2025)
AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization
por: Cemri, Mert, et al.
Publicado: (2026)
por: Cemri, Mert, et al.
Publicado: (2026)
OAT-Rephrase: Optimization-Aware Training Data Rephrasing for Zeroth-Order LLM Fine-Tuning
por: Long, Jikai, et al.
Publicado: (2025)
por: Long, Jikai, et al.
Publicado: (2025)
Refining Adaptive Zeroth-Order Optimization at Ease
por: Shu, Yao, et al.
Publicado: (2025)
por: Shu, Yao, et al.
Publicado: (2025)
Revisiting Zeroth-Order Optimization: Minimum-Variance Two-Point Estimators and Directionally Aligned Perturbations
por: Ma, Shaocong, et al.
Publicado: (2025)
por: Ma, Shaocong, et al.
Publicado: (2025)
Differentially Private Zeroth-Order Methods for Scalable Large Language Model Finetuning
por: Liu, Z, et al.
Publicado: (2024)
por: Liu, Z, et al.
Publicado: (2024)
CurvZO: Adaptive Curvature-Guided Sparse Zeroth-Order Optimization for Efficient LLM Fine-Tuning
por: Wang, Shuo, et al.
Publicado: (2026)
por: Wang, Shuo, et al.
Publicado: (2026)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
por: Zhou, Jiajun, et al.
Publicado: (2025)
por: Zhou, Jiajun, et al.
Publicado: (2025)
Zeroth-Order Optimization Finds Flat Minima
por: Zhang, Liang, et al.
Publicado: (2025)
por: Zhang, Liang, et al.
Publicado: (2025)
A Historical Trajectory Assisted Optimization Method for Zeroth-Order Federated Learning
por: Wu, Chenlin, et al.
Publicado: (2024)
por: Wu, Chenlin, et al.
Publicado: (2024)
Module-Aware Parameter-Efficient Machine Unlearning on Transformers
por: Bao, Wenjie, et al.
Publicado: (2025)
por: Bao, Wenjie, et al.
Publicado: (2025)
MaZO: Masked Zeroth-Order Optimization for Multi-Task Fine-Tuning of Large Language Models
por: Zhang, Zhen, et al.
Publicado: (2025)
por: Zhang, Zhen, et al.
Publicado: (2025)
Zeroth-Order Fine-Tuning of LLMs in Random Subspaces
por: Yu, Ziming, et al.
Publicado: (2024)
por: Yu, Ziming, et al.
Publicado: (2024)
Towards Evaluation for Real-World LLM Unlearning
por: Miao, Ke, et al.
Publicado: (2025)
por: Miao, Ke, et al.
Publicado: (2025)
Subspace-based Approximate Hessian Method for Zeroth-Order Optimization
por: Kim, Dongyoon, et al.
Publicado: (2025)
por: Kim, Dongyoon, et al.
Publicado: (2025)
Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles
por: Tang, Zhiwei, et al.
Publicado: (2023)
por: Tang, Zhiwei, et al.
Publicado: (2023)
AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments
por: Cai, Zhijie, et al.
Publicado: (2026)
por: Cai, Zhijie, et al.
Publicado: (2026)
On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization
por: Ma, Shaocong, et al.
Publicado: (2025)
por: Ma, Shaocong, et al.
Publicado: (2025)
ERASER: Machine Unlearning in MLaaS via an Inference Serving-Aware Approach
por: Hu, Yuke, et al.
Publicado: (2023)
por: Hu, Yuke, et al.
Publicado: (2023)
Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning
por: Jiang, Enyi, et al.
Publicado: (2025)
por: Jiang, Enyi, et al.
Publicado: (2025)
FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness
por: Li, Zhuoyun, et al.
Publicado: (2026)
por: Li, Zhuoyun, et al.
Publicado: (2026)
Mitigating Non-IID Drift in Zeroth-Order Federated LLM Fine-Tuning with Transferable Sparsity
por: Ran, Yide, et al.
Publicado: (2025)
por: Ran, Yide, et al.
Publicado: (2025)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
por: Cheng, Pengyu, et al.
Publicado: (2023)
por: Cheng, Pengyu, et al.
Publicado: (2023)
When Foresight Pruning Meets Zeroth-Order Optimization: Efficient Federated Learning for Low-Memory Devices
por: Zhang, Pengyu, et al.
Publicado: (2024)
por: Zhang, Pengyu, et al.
Publicado: (2024)
ICL Optimized Fragility
por: Wannaz, Serena Gomez
Publicado: (2025)
por: Wannaz, Serena Gomez
Publicado: (2025)
Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity
por: Guo, Wentao, et al.
Publicado: (2024)
por: Guo, Wentao, et al.
Publicado: (2024)
Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
por: Liu, Yong, et al.
Publicado: (2024)
por: Liu, Yong, et al.
Publicado: (2024)
Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
por: Zhang, Jiawen, et al.
Publicado: (2025)
por: Zhang, Jiawen, et al.
Publicado: (2025)
Online Pseudo-Zeroth-Order Training of Neuromorphic Spiking Neural Networks
por: Xiao, Mingqing, et al.
Publicado: (2024)
por: Xiao, Mingqing, et al.
Publicado: (2024)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
por: Luo, Zhifan, et al.
Publicado: (2025)
por: Luo, Zhifan, et al.
Publicado: (2025)
LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
por: Wang, Boxiao, et al.
Publicado: (2026)
por: Wang, Boxiao, et al.
Publicado: (2026)
Turning Stale Gradients into Stable Gradients: Coherent Coordinate Descent with Implicit Landscape Smoothing for Lightweight Zeroth-Order Optimization
por: Liang, Chen, et al.
Publicado: (2026)
por: Liang, Chen, et al.
Publicado: (2026)
Enhancing LLM Reasoning for Time Series Classification by Tailored Thinking and Fused Decision
por: Zhou, Jiahui, et al.
Publicado: (2025)
por: Zhou, Jiahui, et al.
Publicado: (2025)
Communication-Efficient and Differentially Private Vertical Federated Learning with Zeroth-Order Optimization
por: Zhang, Jianing, et al.
Publicado: (2025)
por: Zhang, Jianing, et al.
Publicado: (2025)
Perturbation-efficient Zeroth-order Optimization for Hardware-friendly On-device Training
por: Tan, Qitao, et al.
Publicado: (2025)
por: Tan, Qitao, et al.
Publicado: (2025)
HELENE: Hessian Layer-wise Clipping and Gradient Annealing for Accelerating Fine-tuning LLM with Zeroth-order Optimization
por: Zhao, Huaqin, et al.
Publicado: (2024)
por: Zhao, Huaqin, et al.
Publicado: (2024)
Graph-Regularized Sparse Autoencoders for LLM Safety Steering
por: Yeon, Jehyeok, et al.
Publicado: (2025)
por: Yeon, Jehyeok, et al.
Publicado: (2025)
Aligning Dense Retrievers with LLM Utility via Distillation
por: Sandhu, Rajinder, et al.
Publicado: (2026)
por: Sandhu, Rajinder, et al.
Publicado: (2026)
Ejemplares similares
-
Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer
por: Feng, Jian, et al.
Publicado: (2026) -
Localized Zeroth-Order Prompt Optimization
por: Hu, Wenyang, et al.
Publicado: (2024) -
Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint
por: Liu, Zhihao, et al.
Publicado: (2025) -
AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization
por: Cemri, Mert, et al.
Publicado: (2026) -
OAT-Rephrase: Optimization-Aware Training Data Rephrasing for Zeroth-Order LLM Fine-Tuning
por: Long, Jikai, et al.
Publicado: (2025)