Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Haokun, Szyller, Sebastian, Xu, Weilin, Himayat, Nageen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Imperceptible Adversarial Examples in the Physical World
von: Xu, Weilin, et al.
Veröffentlicht: (2024)
von: Xu, Weilin, et al.
Veröffentlicht: (2024)
Soft Prompting for Unlearning in Large Language Models
von: Bhaila, Karuna, et al.
Veröffentlicht: (2024)
von: Bhaila, Karuna, et al.
Veröffentlicht: (2024)
Large Language Models Cannot Self-Correct Reasoning Yet
von: Huang, Jie, et al.
Veröffentlicht: (2023)
von: Huang, Jie, et al.
Veröffentlicht: (2023)
IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact
von: Liu, Ruikang, et al.
Veröffentlicht: (2024)
von: Liu, Ruikang, et al.
Veröffentlicht: (2024)
Large Language Model Unlearning
von: Yao, Yuanshun, et al.
Veröffentlicht: (2023)
von: Yao, Yuanshun, et al.
Veröffentlicht: (2023)
AuditWen:An Open-Source Large Language Model for Audit
von: Huang, Jiajia, et al.
Veröffentlicht: (2024)
von: Huang, Jiajia, et al.
Veröffentlicht: (2024)
Understanding the Dilemma of Unlearning for Large Language Models
von: Zhang, Qingjie, et al.
Veröffentlicht: (2025)
von: Zhang, Qingjie, et al.
Veröffentlicht: (2025)
Machine Unlearning in Large Language Models
von: Gundavarapu, Saaketh Koundinya, et al.
Veröffentlicht: (2024)
von: Gundavarapu, Saaketh Koundinya, et al.
Veröffentlicht: (2024)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
von: Lee, Hong kyu, et al.
Veröffentlicht: (2025)
von: Lee, Hong kyu, et al.
Veröffentlicht: (2025)
Offset Unlearning for Large Language Models
von: Huang, James Y., et al.
Veröffentlicht: (2024)
von: Huang, James Y., et al.
Veröffentlicht: (2024)
CALM: Curiosity-Driven Auditing for Large Language Models
von: Zheng, Xiang, et al.
Veröffentlicht: (2025)
von: Zheng, Xiang, et al.
Veröffentlicht: (2025)
A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models
von: Geng, Jiahui, et al.
Veröffentlicht: (2025)
von: Geng, Jiahui, et al.
Veröffentlicht: (2025)
MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models
von: Huo, Jiahao, et al.
Veröffentlicht: (2025)
von: Huo, Jiahao, et al.
Veröffentlicht: (2025)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
von: Liu, Peijie, et al.
Veröffentlicht: (2025)
von: Liu, Peijie, et al.
Veröffentlicht: (2025)
Enhancing O-RAN Security: Evasion Attacks and Robust Defenses for Graph Reinforcement Learning-based Connection Management
von: Balakrishnan, Ravikumar, et al.
Veröffentlicht: (2024)
von: Balakrishnan, Ravikumar, et al.
Veröffentlicht: (2024)
What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models
von: Karmakar, Ranit, et al.
Veröffentlicht: (2026)
von: Karmakar, Ranit, et al.
Veröffentlicht: (2026)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
von: Zheng, Hao, et al.
Veröffentlicht: (2025)
von: Zheng, Hao, et al.
Veröffentlicht: (2025)
On Effects of Steering Latent Representation for Large Language Model Unlearning
von: Huu-Tien, Dang, et al.
Veröffentlicht: (2024)
von: Huu-Tien, Dang, et al.
Veröffentlicht: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
Output Scouting: Auditing Large Language Models for Catastrophic Responses
von: Bell, Andrew, et al.
Veröffentlicht: (2024)
von: Bell, Andrew, et al.
Veröffentlicht: (2024)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
von: Feng, Zhili, et al.
Veröffentlicht: (2025)
von: Feng, Zhili, et al.
Veröffentlicht: (2025)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
von: Wang, Dixuan, et al.
Veröffentlicht: (2024)
von: Wang, Dixuan, et al.
Veröffentlicht: (2024)
Can LLMs Evaluate What They Cannot Annotate? Revisiting LLM Reliability in Hate Speech Detection
von: Piot, Paloma, et al.
Veröffentlicht: (2025)
von: Piot, Paloma, et al.
Veröffentlicht: (2025)
Learning and Unlearning of Fabricated Knowledge in Language Models
von: Sun, Chen, et al.
Veröffentlicht: (2024)
von: Sun, Chen, et al.
Veröffentlicht: (2024)
Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models
von: Shukla, Divyaksh, et al.
Veröffentlicht: (2026)
von: Shukla, Divyaksh, et al.
Veröffentlicht: (2026)
Hierarchical Federated Unlearning for Large Language Models
von: Zhong, Yisheng, et al.
Veröffentlicht: (2025)
von: Zhong, Yisheng, et al.
Veröffentlicht: (2025)
Multi-Objective Large Language Model Unlearning
von: Pan, Zibin, et al.
Veröffentlicht: (2024)
von: Pan, Zibin, et al.
Veröffentlicht: (2024)
Hypothesis Generation with Large Language Models
von: Zhou, Yangqiaoyu, et al.
Veröffentlicht: (2024)
von: Zhou, Yangqiaoyu, et al.
Veröffentlicht: (2024)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
von: Feng, Xiaohua, et al.
Veröffentlicht: (2025)
von: Feng, Xiaohua, et al.
Veröffentlicht: (2025)
A Closer Look at Machine Unlearning for Large Language Models
von: Yuan, Xiaojian, et al.
Veröffentlicht: (2024)
von: Yuan, Xiaojian, et al.
Veröffentlicht: (2024)
ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs
von: Chen, Xunlei, et al.
Veröffentlicht: (2026)
von: Chen, Xunlei, et al.
Veröffentlicht: (2026)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
von: Guang, Jiahui, et al.
Veröffentlicht: (2026)
von: Guang, Jiahui, et al.
Veröffentlicht: (2026)
UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models
von: Dong, Yijiang River, et al.
Veröffentlicht: (2024)
von: Dong, Yijiang River, et al.
Veröffentlicht: (2024)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
von: Zhao, Yang, et al.
Veröffentlicht: (2024)
von: Zhao, Yang, et al.
Veröffentlicht: (2024)
PRISM: A Methodology for Auditing Biases in Large Language Models
von: Azzopardi, Leif, et al.
Veröffentlicht: (2024)
von: Azzopardi, Leif, et al.
Veröffentlicht: (2024)
Enhancing Large Language Models for Mobility Analytics with Semantic Location Tokenization
von: Chen, Yile, et al.
Veröffentlicht: (2025)
von: Chen, Yile, et al.
Veröffentlicht: (2025)
Deep Contrastive Unlearning for Language Models
von: He, Estrid, et al.
Veröffentlicht: (2025)
von: He, Estrid, et al.
Veröffentlicht: (2025)
Counting Ability of Large Language Models and Impact of Tokenization
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
Don't Change My View: Ideological Bias Auditing in Large Language Models
von: Kröger, Paul, et al.
Veröffentlicht: (2025)
von: Kröger, Paul, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Imperceptible Adversarial Examples in the Physical World
von: Xu, Weilin, et al.
Veröffentlicht: (2024) -
Soft Prompting for Unlearning in Large Language Models
von: Bhaila, Karuna, et al.
Veröffentlicht: (2024) -
Large Language Models Cannot Self-Correct Reasoning Yet
von: Huang, Jie, et al.
Veröffentlicht: (2023) -
IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact
von: Liu, Ruikang, et al.
Veröffentlicht: (2024) -
Large Language Model Unlearning
von: Yao, Yuanshun, et al.
Veröffentlicht: (2023)