LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Veldanda, Akshaj Kumar, Zhang, Shi-Xiong, Das, Anirban, Chakraborty, Supriyo, Rawls, Stephen, Sahu, Sambit, Naphade, Milind |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SPEAR-MM: Selective Parameter Evaluation and Restoration via Model Merging for Efficient Financial LLM Adaptation
par: Kapusuzoglu, Berkcan, et autres
Publié: (2025)
par: Kapusuzoglu, Berkcan, et autres
Publié: (2025)
T1: A Tool-Oriented Conversational Dataset for Multi-Turn Agentic Planning
par: Chakraborty, Amartya, et autres
Publié: (2025)
par: Chakraborty, Amartya, et autres
Publié: (2025)
DIAL-SUMMER: A Structured Evaluation Framework of Hierarchical Errors in Dialogue Summaries
par: Ramnath, Sahana, et autres
Publié: (2026)
par: Ramnath, Sahana, et autres
Publié: (2026)
Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning
par: Mircea, Andrei, et autres
Publié: (2025)
par: Mircea, Andrei, et autres
Publié: (2025)
Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups
par: Veldanda, Gautam
Publié: (2026)
par: Veldanda, Gautam
Publié: (2026)
Continual Pre-training of MoEs: How robust is your router?
par: Thérien, Benjamin, et autres
Publié: (2025)
par: Thérien, Benjamin, et autres
Publié: (2025)
Critique-Guided Distillation for Robust Reasoning via Refinement
par: Kapusuzoglu, Berkcan, et autres
Publié: (2025)
par: Kapusuzoglu, Berkcan, et autres
Publié: (2025)
Leveraging Parameter Space Symmetries for Reasoning Skill Transfer in LLMs
par: Horoi, Stefan, et autres
Publié: (2025)
par: Horoi, Stefan, et autres
Publié: (2025)
Routing with Generated Data: Annotation-Free LLM Skill Estimation and Expert Selection
par: Niu, Tianyi, et autres
Publié: (2026)
par: Niu, Tianyi, et autres
Publié: (2026)
Investigating Model Editing for Unlearning in Large Language Models
par: Hossain, Shariqah, et autres
Publié: (2025)
par: Hossain, Shariqah, et autres
Publié: (2025)
Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey
par: Winata, Genta Indra, et autres
Publié: (2024)
par: Winata, Genta Indra, et autres
Publié: (2024)
Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study
par: Surana, Mokshit, et autres
Publié: (2026)
par: Surana, Mokshit, et autres
Publié: (2026)
Resolving Editing-Unlearning Conflicts: A Knowledge Codebook Framework for Large Language Model Updating
par: Zhang, Binchi, et autres
Publié: (2025)
par: Zhang, Binchi, et autres
Publié: (2025)
Your Model Diversity, Not Method, Determines Reasoning Strategy
par: Choraria, Moulik, et autres
Publié: (2026)
par: Choraria, Moulik, et autres
Publié: (2026)
Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?
par: Lee, Chia-Hsuan, et autres
Publié: (2026)
par: Lee, Chia-Hsuan, et autres
Publié: (2026)
KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning
par: Luo, Yinyi, et autres
Publié: (2025)
par: Luo, Yinyi, et autres
Publié: (2025)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
par: Lin, Yujie, et autres
Publié: (2026)
par: Lin, Yujie, et autres
Publié: (2026)
DIEKAE: Difference Injection for Efficient Knowledge Augmentation and Editing of Large Language Models
par: Galatolo, Alessio, et autres
Publié: (2024)
par: Galatolo, Alessio, et autres
Publié: (2024)
Stable Knowledge Editing in Large Language Models
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024)
par: Guo, Phillip, et autres
Publié: (2024)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
par: Gu, Leijiang, et autres
Publié: (2026)
par: Gu, Leijiang, et autres
Publié: (2026)
Hyper-parameter Tuning for Fair Classification without Sensitive Attribute Access
par: Veldanda, Akshaj Kumar, et autres
Publié: (2023)
par: Veldanda, Akshaj Kumar, et autres
Publié: (2023)
Knowledge Graph Enhanced Large Language Model Editing
par: Zhang, Mengqi, et autres
Publié: (2024)
par: Zhang, Mengqi, et autres
Publié: (2024)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
par: He, Guoxiu, et autres
Publié: (2025)
par: He, Guoxiu, et autres
Publié: (2025)
Neighboring Perturbations of Knowledge Editing on Large Language Models
par: Ma, Jun-Yu, et autres
Publié: (2024)
par: Ma, Jun-Yu, et autres
Publié: (2024)
Disentangling Knowledge Representations for Large Language Model Editing
par: Zhang, Mengqi, et autres
Publié: (2025)
par: Zhang, Mengqi, et autres
Publié: (2025)
Knowledge Editing for Large Language Model with Knowledge Neuronal Ensemble
par: Li, Yongchang, et autres
Publié: (2024)
par: Li, Yongchang, et autres
Publié: (2024)
Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Models
par: Hsueh, Cheng-Hsun, et autres
Publié: (2024)
par: Hsueh, Cheng-Hsun, et autres
Publié: (2024)
Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
par: Lu, Weikai, et autres
Publié: (2024)
par: Lu, Weikai, et autres
Publié: (2024)
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
par: Hu, Chenhui, et autres
Publié: (2024)
par: Hu, Chenhui, et autres
Publié: (2024)
GeoEdit: Geometric Knowledge Editing for Large Language Models
par: Feng, Yujie, et autres
Publié: (2025)
par: Feng, Yujie, et autres
Publié: (2025)
Mechanistic Circuit-Based Knowledge Editing in Large Language Models
par: Zhao, Tianyi, et autres
Publié: (2026)
par: Zhao, Tianyi, et autres
Publié: (2026)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
par: Zhao, Yang, et autres
Publié: (2024)
par: Zhao, Yang, et autres
Publié: (2024)
Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models
par: Mekala, Anmol, et autres
Publié: (2024)
par: Mekala, Anmol, et autres
Publié: (2024)
Identifying Knowledge Editing Types in Large Language Models
par: Li, Xiaopeng, et autres
Publié: (2024)
par: Li, Xiaopeng, et autres
Publié: (2024)
Cross-Lingual Knowledge Editing in Large Language Models
par: Wang, Jiaan, et autres
Publié: (2023)
par: Wang, Jiaan, et autres
Publié: (2023)
Knowledge Editing for Large Language Models: A Survey
par: Wang, Song, et autres
Publié: (2023)
par: Wang, Song, et autres
Publié: (2023)
Consistency-Aware Editing for Entity-level Unlearning in Language Models
par: Han, Xiaoqi, et autres
Publié: (2025)
par: Han, Xiaoqi, et autres
Publié: (2025)
Rethinking Machine Unlearning for Large Language Models
par: Liu, Sijia, et autres
Publié: (2024)
par: Liu, Sijia, et autres
Publié: (2024)
Mechanistic Behavior Editing of Language Models
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Documents similaires
-
SPEAR-MM: Selective Parameter Evaluation and Restoration via Model Merging for Efficient Financial LLM Adaptation
par: Kapusuzoglu, Berkcan, et autres
Publié: (2025) -
T1: A Tool-Oriented Conversational Dataset for Multi-Turn Agentic Planning
par: Chakraborty, Amartya, et autres
Publié: (2025) -
DIAL-SUMMER: A Structured Evaluation Framework of Hierarchical Errors in Dialogue Summaries
par: Ramnath, Sahana, et autres
Publié: (2026) -
Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning
par: Mircea, Andrei, et autres
Publié: (2025) -
Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups
par: Veldanda, Gautam
Publié: (2026)