Revealing the Deceptiveness of Knowledge Editing: A Mechanistic Analysis of Superficial Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Jiakuan, Cao, Pengfei, Chen, Yubo, Liu, Kang, Zhao, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MEMLA: Enhancing Multilingual Knowledge Editing with Neuron-Masked Low-Rank Adaptation
by: Xie, Jiakuan, et al.
Published: (2024)
by: Xie, Jiakuan, et al.
Published: (2024)
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
by: Hu, Chenhui, et al.
Published: (2024)
by: Hu, Chenhui, et al.
Published: (2024)
WilKE: Wise-Layer Knowledge Editor for Lifelong Knowledge Editing
by: Hu, Chenhui, et al.
Published: (2024)
by: Hu, Chenhui, et al.
Published: (2024)
EvoEdit: Lifelong Free-Text Knowledge Editing through Latent Perturbation Augmentation and Knowledge-driven Parameter Fusion
by: Cao, Pengfei, et al.
Published: (2025)
by: Cao, Pengfei, et al.
Published: (2025)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
by: Men, Tianyi, et al.
Published: (2024)
by: Men, Tianyi, et al.
Published: (2024)
Mechanistic Circuit-Based Knowledge Editing in Large Language Models
by: Zhao, Tianyi, et al.
Published: (2026)
by: Zhao, Tianyi, et al.
Published: (2026)
Cracking Factual Knowledge: A Comprehensive Analysis of Degenerate Knowledge Neurons in Large Language Models
by: Chen, Yuheng, et al.
Published: (2024)
by: Chen, Yuheng, et al.
Published: (2024)
Knowledge Localization: Mission Not Accomplished? Enter Query Localization!
by: Chen, Yuheng, et al.
Published: (2024)
by: Chen, Yuheng, et al.
Published: (2024)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
by: Cao, Pengfei, et al.
Published: (2024)
by: Cao, Pengfei, et al.
Published: (2024)
EVEDIT: Event-based Knowledge Editing with Deductive Editing Boundaries
by: Liu, Jiateng, et al.
Published: (2024)
by: Liu, Jiateng, et al.
Published: (2024)
Commonsense Knowledge Editing Based on Free-Text in LLMs
by: Huang, Xiusheng, et al.
Published: (2024)
by: Huang, Xiusheng, et al.
Published: (2024)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
by: Guo, Phillip, et al.
Published: (2024)
by: Guo, Phillip, et al.
Published: (2024)
The Knowledge Microscope: Features as Better Analytical Lenses than Neurons
by: Chen, Yuheng, et al.
Published: (2025)
by: Chen, Yuheng, et al.
Published: (2025)
Revealing and Mitigating Over-Attention in Knowledge Editing
by: Wang, Pinzheng, et al.
Published: (2025)
by: Wang, Pinzheng, et al.
Published: (2025)
Towards Atoms of Large Language Models
by: Hu, Chenhui, et al.
Published: (2025)
by: Hu, Chenhui, et al.
Published: (2025)
A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
by: Men, Tianyi, et al.
Published: (2024)
by: Men, Tianyi, et al.
Published: (2024)
CogMG: Collaborative Augmentation Between Large Language Model and Knowledge Graph
by: Zhou, Tong, et al.
Published: (2024)
by: Zhou, Tong, et al.
Published: (2024)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
by: Yuan, Hongbang, et al.
Published: (2024)
by: Yuan, Hongbang, et al.
Published: (2024)
Editing Across Languages: A Survey of Multilingual Knowledge Editing
by: Durrani, Nadir, et al.
Published: (2025)
by: Durrani, Nadir, et al.
Published: (2025)
Mechanistic Behavior Editing of Language Models
by: Singh, Joykirat, et al.
Published: (2024)
by: Singh, Joykirat, et al.
Published: (2024)
On the Robustness of Knowledge Editing for Detoxification
by: Dong, Ming, et al.
Published: (2026)
by: Dong, Ming, et al.
Published: (2026)
Joint Knowledge Editing for Information Enrichment and Probability Promotion
by: Shi, Wenhang, et al.
Published: (2024)
by: Shi, Wenhang, et al.
Published: (2024)
Tug-of-War Between Knowledge: Exploring and Resolving Knowledge Conflicts in Retrieval-Augmented Language Models
by: Jin, Zhuoran, et al.
Published: (2024)
by: Jin, Zhuoran, et al.
Published: (2024)
Neighboring Perturbations of Knowledge Editing on Large Language Models
by: Ma, Jun-Yu, et al.
Published: (2024)
by: Ma, Jun-Yu, et al.
Published: (2024)
ScEdit: Script-based Assessment of Knowledge Editing
by: Li, Xinye, et al.
Published: (2025)
by: Li, Xinye, et al.
Published: (2025)
Event-level Knowledge Editing
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
by: Men, Tianyi, et al.
Published: (2025)
by: Men, Tianyi, et al.
Published: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
by: Li, Jiachun, et al.
Published: (2024)
by: Li, Jiachun, et al.
Published: (2024)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
by: Yuan, Hongbang, et al.
Published: (2024)
by: Yuan, Hongbang, et al.
Published: (2024)
Beyond Memorization: A Rigorous Evaluation Framework for Medical Knowledge Editing
by: Chen, Shigeng, et al.
Published: (2025)
by: Chen, Shigeng, et al.
Published: (2025)
Know-MRI: A Knowledge Mechanisms Revealer&Interpreter for Large Language Models
by: Liu, Jiaxiang, et al.
Published: (2025)
by: Liu, Jiaxiang, et al.
Published: (2025)
Knowledge Editing through Chain-of-Thought
by: Wang, Changyue, et al.
Published: (2024)
by: Wang, Changyue, et al.
Published: (2024)
The Anatomy of an Edit: Mechanism-Guided Activation Steering for Knowledge Editing
by: Cao, Yuan, et al.
Published: (2026)
by: Cao, Yuan, et al.
Published: (2026)
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
by: Hao, Yupu, et al.
Published: (2025)
by: Hao, Yupu, et al.
Published: (2025)
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
by: Hao, Yupu, et al.
Published: (2024)
by: Hao, Yupu, et al.
Published: (2024)
DTELS: Towards Dynamic Granularity of Timeline Summarization
by: Zhang, Chenlong, et al.
Published: (2024)
by: Zhang, Chenlong, et al.
Published: (2024)
Continual Few-shot Event Detection via Hierarchical Augmentation Networks
by: Zhang, Chenlong, et al.
Published: (2024)
by: Zhang, Chenlong, et al.
Published: (2024)
An Exploration of Knowledge Editing for Arabic
by: Mousi, Basel, et al.
Published: (2025)
by: Mousi, Basel, et al.
Published: (2025)
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
by: Cai, Yuchen, et al.
Published: (2024)
by: Cai, Yuchen, et al.
Published: (2024)
Diagnosing Model Editing via Knowledge Spectrum
by: Pan, Tsung-Hsuan, et al.
Published: (2025)
by: Pan, Tsung-Hsuan, et al.
Published: (2025)
Similar Items
-
MEMLA: Enhancing Multilingual Knowledge Editing with Neuron-Masked Low-Rank Adaptation
by: Xie, Jiakuan, et al.
Published: (2024) -
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
by: Hu, Chenhui, et al.
Published: (2024) -
WilKE: Wise-Layer Knowledge Editor for Lifelong Knowledge Editing
by: Hu, Chenhui, et al.
Published: (2024) -
EvoEdit: Lifelong Free-Text Knowledge Editing through Latent Perturbation Augmentation and Knowledge-driven Parameter Fusion
by: Cao, Pengfei, et al.
Published: (2025) -
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
by: Men, Tianyi, et al.
Published: (2024)