Understanding the Dilemma of Unlearning for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Qingjie, Qian, Haoting, Huang, Zhicong, Hong, Cheng, Huang, Minlie, Xu, Ke, Zhang, Chao, Qiu, Han |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models
par: Zhang, Qingjie, et autres
Publié: (2025)
par: Zhang, Qingjie, et autres
Publié: (2025)
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Understanding the Dark Side of LLMs' Intrinsic Self-Correction
par: Zhang, Qingjie, et autres
Publié: (2024)
par: Zhang, Qingjie, et autres
Publié: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
par: Gu, Yuxian, et autres
Publié: (2023)
par: Gu, Yuxian, et autres
Publié: (2023)
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
par: Wen, Zhihua, et autres
Publié: (2024)
par: Wen, Zhihua, et autres
Publié: (2024)
Offset Unlearning for Large Language Models
par: Huang, James Y., et autres
Publié: (2024)
par: Huang, James Y., et autres
Publié: (2024)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025)
par: Lu, Yida, et autres
Publié: (2025)
Multi-Objective Large Language Model Unlearning
par: Pan, Zibin, et autres
Publié: (2024)
par: Pan, Zibin, et autres
Publié: (2024)
Speculating LLMs' Chinese Training Data Pollution from Their Tokens
par: Zhang, Qingjie, et autres
Publié: (2025)
par: Zhang, Qingjie, et autres
Publié: (2025)
Towards Understanding the Cognitive Habits of Large Reasoning Models
par: Dong, Jianshuo, et autres
Publié: (2025)
par: Dong, Jianshuo, et autres
Publié: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
par: Ke, Pei, et autres
Publié: (2023)
par: Ke, Pei, et autres
Publié: (2023)
On the Tip of the Tongue: Analyzing Conceptual Representation in Large Language Models with Reverse-Dictionary Probe
par: Xu, Ningyu, et autres
Publié: (2024)
par: Xu, Ningyu, et autres
Publié: (2024)
Large Language Model Unlearning
par: Yao, Yuanshun, et autres
Publié: (2023)
par: Yao, Yuanshun, et autres
Publié: (2023)
From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models
par: Li, Wenxuan, et autres
Publié: (2026)
par: Li, Wenxuan, et autres
Publié: (2026)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
A Closer Look at Machine Unlearning for Large Language Models
par: Yuan, Xiaojian, et autres
Publié: (2024)
par: Yuan, Xiaojian, et autres
Publié: (2024)
Do Large Language Models Understand Logic or Just Mimick Context?
par: Yan, Junbing, et autres
Publié: (2024)
par: Yan, Junbing, et autres
Publié: (2024)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
par: Cheng, Jiale, et autres
Publié: (2024)
par: Cheng, Jiale, et autres
Publié: (2024)
Deep Contrastive Unlearning for Language Models
par: He, Estrid, et autres
Publié: (2025)
par: He, Estrid, et autres
Publié: (2025)
GraphInstruct: Empowering Large Language Models with Graph Understanding and Reasoning Capability
par: Luo, Zihan, et autres
Publié: (2024)
par: Luo, Zihan, et autres
Publié: (2024)
Machine Unlearning in Large Language Models
par: Gundavarapu, Saaketh Koundinya, et autres
Publié: (2024)
par: Gundavarapu, Saaketh Koundinya, et autres
Publié: (2024)
Geometric-disentangelment Unlearning
par: Zhou, Duo, et autres
Publié: (2025)
par: Zhou, Duo, et autres
Publié: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
par: Jin, Haoran, et autres
Publié: (2025)
par: Jin, Haoran, et autres
Publié: (2025)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
par: Sabour, Sahand, et autres
Publié: (2024)
par: Sabour, Sahand, et autres
Publié: (2024)
When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models
par: Wang, Cheng, et autres
Publié: (2025)
par: Wang, Cheng, et autres
Publié: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
par: Dong, Jianshuo, et autres
Publié: (2025)
par: Dong, Jianshuo, et autres
Publié: (2025)
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
par: Xu, Rongwu, et autres
Publié: (2024)
par: Xu, Rongwu, et autres
Publié: (2024)
Language Model Prompt Selection via Simulation Optimization
par: Zhang, Haoting, et autres
Publié: (2024)
par: Zhang, Haoting, et autres
Publié: (2024)
Assessing and Understanding Creativity in Large Language Models
par: Zhao, Yunpu, et autres
Publié: (2024)
par: Zhao, Yunpu, et autres
Publié: (2024)
MUSE: Machine Unlearning Six-Way Evaluation for Language Models
par: Shi, Weijia, et autres
Publié: (2024)
par: Shi, Weijia, et autres
Publié: (2024)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
par: Huang, Xu, et autres
Publié: (2024)
par: Huang, Xu, et autres
Publié: (2024)
SHA256 at SemEval-2025 Task 4: Selective Amnesia -- Constrained Unlearning for Large Language Models via Knowledge Isolation
par: Agrawal, Saransh, et autres
Publié: (2025)
par: Agrawal, Saransh, et autres
Publié: (2025)
Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models
par: Chen, Haokun, et autres
Publié: (2025)
par: Chen, Haokun, et autres
Publié: (2025)
Continual Learning Using Only Large Language Model Prompting
par: Qiu, Jiabao, et autres
Publié: (2024)
par: Qiu, Jiabao, et autres
Publié: (2024)
ECLM: Entity Level Language Model for Spoken Language Understanding with Chain of Intent
par: Yin, Shangjian, et autres
Publié: (2024)
par: Yin, Shangjian, et autres
Publié: (2024)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
par: Cheng, Jiale, et autres
Publié: (2024)
par: Cheng, Jiale, et autres
Publié: (2024)
Synergetic Event Understanding: A Collaborative Approach to Cross-Document Event Coreference Resolution with Large Language Models
par: Min, Qingkai, et autres
Publié: (2024)
par: Min, Qingkai, et autres
Publié: (2024)
AuditWen:An Open-Source Large Language Model for Audit
par: Huang, Jiajia, et autres
Publié: (2024)
par: Huang, Jiajia, et autres
Publié: (2024)
Documents similaires
-
Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models
par: Zhang, Qingjie, et autres
Publié: (2025) -
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026) -
Understanding the Dark Side of LLMs' Intrinsic Self-Correction
par: Zhang, Qingjie, et autres
Publié: (2024) -
MiniLLM: On-Policy Distillation of Large Language Models
par: Gu, Yuxian, et autres
Publié: (2023) -
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
par: Wen, Zhihua, et autres
Publié: (2024)