$\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Pengyu, Zhang, Lingling, Gao, Zhitao, Wu, Yanrui, Dong, Yuxuan, Liu, Huan, Wei, Bifan, Liu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LogicGraph : Benchmarking Multi-Path Logical Reasoning via Neuro-Symbolic Generation and Verification
di: Wu, Yanrui, et al.
Pubblicazione: (2026)
di: Wu, Yanrui, et al.
Pubblicazione: (2026)
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
di: Zhang, Yimeng, et al.
Pubblicazione: (2024)
di: Zhang, Yimeng, et al.
Pubblicazione: (2024)
Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension
di: Wang, Yaxian, et al.
Pubblicazione: (2025)
di: Wang, Yaxian, et al.
Pubblicazione: (2025)
GKG-LLM: A Unified Framework for Generalized Knowledge Graph Construction
di: Zhang, Jian, et al.
Pubblicazione: (2025)
di: Zhang, Jian, et al.
Pubblicazione: (2025)
From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision
di: Ma, Jie, et al.
Pubblicazione: (2025)
di: Ma, Jie, et al.
Pubblicazione: (2025)
Finite axiomatization of $\textbf{GL}\times\textbf{S5}$ and $\textbf{Grz}\times\textbf{S5}$
di: Bezhanishvili, Guram, et al.
Pubblicazione: (2025)
di: Bezhanishvili, Guram, et al.
Pubblicazione: (2025)
Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems
di: Qi, Shihao, et al.
Pubblicazione: (2026)
di: Qi, Shihao, et al.
Pubblicazione: (2026)
The lattices $\textbf m\times\textbf 2$ and $\textbf m\times\textbf 3$ are not Schur positive
di: Wang, David G. L., et al.
Pubblicazione: (2025)
di: Wang, David G. L., et al.
Pubblicazione: (2025)
Learning to Unlearn for Robust Machine Unlearning
di: Huang, Mark He, et al.
Pubblicazione: (2024)
di: Huang, Mark He, et al.
Pubblicazione: (2024)
D-Branes in $\textbf{AdS}_3\times \textbf{S}^3 \times \textbf{S}^3 \times \textbf{S}^1$
di: Belleri, Giorgio, et al.
Pubblicazione: (2025)
di: Belleri, Giorgio, et al.
Pubblicazione: (2025)
Data-Dependent Stability Analysis of Adversarial Training
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
QGEval: Benchmarking Multi-dimensional Evaluation for Question Generation
di: Fu, Weiping, et al.
Pubblicazione: (2024)
di: Fu, Weiping, et al.
Pubblicazione: (2024)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
di: Qiu, Zeju, et al.
Pubblicazione: (2025)
di: Qiu, Zeju, et al.
Pubblicazione: (2025)
AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
Adam Improves Muon: Adaptive Moment Estimation with Orthogonalized Momentum
di: Zhang, Minxin, et al.
Pubblicazione: (2026)
di: Zhang, Minxin, et al.
Pubblicazione: (2026)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
di: Wang, Pinzheng, et al.
Pubblicazione: (2026)
di: Wang, Pinzheng, et al.
Pubblicazione: (2026)
AGT/Z$_2$
di: Floch, Bruno Le, et al.
Pubblicazione: (2017)
di: Floch, Bruno Le, et al.
Pubblicazione: (2017)
GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection
di: Deng, Zhijie, et al.
Pubblicazione: (2025)
di: Deng, Zhijie, et al.
Pubblicazione: (2025)
OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback
di: Gao, Zhitao, et al.
Pubblicazione: (2026)
di: Gao, Zhitao, et al.
Pubblicazione: (2026)
FedAU2: Attribute Unlearning for User-Level Federated Recommender Systems with Adaptive and Robust Adversarial Training
di: Li, Yuyuan, et al.
Pubblicazione: (2025)
di: Li, Yuyuan, et al.
Pubblicazione: (2025)
PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization
di: Wu, Wenhan, et al.
Pubblicazione: (2025)
di: Wu, Wenhan, et al.
Pubblicazione: (2025)
Improving White-box Robustness of Pre-processing Defenses via Joint Adversarial Training
di: Zhou, Dawei, et al.
Pubblicazione: (2021)
di: Zhou, Dawei, et al.
Pubblicazione: (2021)
ROOT: Robust Orthogonalized Optimizer for Neural Network Training
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
Search for and analysis of eclipsing binaries in the LAMOST Medium-Resolution Survey field. I. RA: $\textbf{23}^h$$\textbf{01}^m$$\textbf{51}^s$, Dec: +34$^\circ$36$^\prime$45$^{\prime \prime}$
di: Wang, Jing-Yi, et al.
Pubblicazione: (2024)
di: Wang, Jing-Yi, et al.
Pubblicazione: (2024)
LLM Unlearning via Loss Adjustment with Only Forget Data
di: Wang, Yaxuan, et al.
Pubblicazione: (2024)
di: Wang, Yaxuan, et al.
Pubblicazione: (2024)
HAGGNN : Hydration‐Aware Geometric Graph Neural Network for Protein Thermal Stability Prediction
di: Yingying Jiang, et al.
Pubblicazione: (2026)
di: Yingying Jiang, et al.
Pubblicazione: (2026)
Adversarial Machine Unlearning
di: Di, Zonglin, et al.
Pubblicazione: (2024)
di: Di, Zonglin, et al.
Pubblicazione: (2024)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
di: Wang, Yaxuan, et al.
Pubblicazione: (2025)
di: Wang, Yaxuan, et al.
Pubblicazione: (2025)
Robustness Feature Adapter for Efficient Adversarial Training
di: Wu, Quanwei, et al.
Pubblicazione: (2025)
di: Wu, Quanwei, et al.
Pubblicazione: (2025)
UNO: Unlearning via Orthogonalization in Generative models
di: Mandal, Pinak, et al.
Pubblicazione: (2025)
di: Mandal, Pinak, et al.
Pubblicazione: (2025)
Enhancing Adversarial Robustness via Uncertainty-Aware Distributional Adversarial Training
di: Dong, Junhao, et al.
Pubblicazione: (2024)
di: Dong, Junhao, et al.
Pubblicazione: (2024)
Dual-Space Smoothness for Robust and Balanced LLM Unlearning
di: Yan, Han, et al.
Pubblicazione: (2025)
di: Yan, Han, et al.
Pubblicazione: (2025)
LLM Unlearning with LLM Beliefs
di: Li, Kemou, et al.
Pubblicazione: (2025)
di: Li, Kemou, et al.
Pubblicazione: (2025)
Machine Unlearning Meets Adversarial Robustness via Constrained Interventions on LLMs
di: Rezkellah, Fatmazohra, et al.
Pubblicazione: (2025)
di: Rezkellah, Fatmazohra, et al.
Pubblicazione: (2025)
ROKA: Robust Knowledge Unlearning against Adversaries
di: Shin, Jinmyeong, et al.
Pubblicazione: (2026)
di: Shin, Jinmyeong, et al.
Pubblicazione: (2026)
A slow review of the AGT correspondence
di: Floch, Bruno Le
Pubblicazione: (2020)
di: Floch, Bruno Le
Pubblicazione: (2020)
Documenti analoghi
-
LogicGraph : Benchmarking Multi-Path Logical Reasoning via Neuro-Symbolic Generation and Verification
di: Wu, Yanrui, et al.
Pubblicazione: (2026) -
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
di: Zhang, Yimeng, et al.
Pubblicazione: (2024) -
Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving
di: Zhang, Xinyu, et al.
Pubblicazione: (2026) -
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024) -
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension
di: Wang, Yaxian, et al.
Pubblicazione: (2025)