Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yujian, Zhang, Yang, Jaakkola, Tommi, Chang, Shiyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fictitious Synthetic Data Can Improve LLM Factuality via Prerequisite Learning
di: Liu, Yujian, et al.
Pubblicazione: (2024)
di: Liu, Yujian, et al.
Pubblicazione: (2024)
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
di: Liu, Yujian, et al.
Pubblicazione: (2026)
di: Liu, Yujian, et al.
Pubblicazione: (2026)
HarnessLLM: Automatic Testing Harness Generation via Reinforcement Learning
di: Liu, Yujian, et al.
Pubblicazione: (2025)
di: Liu, Yujian, et al.
Pubblicazione: (2025)
Correcting Diffusion Generation through Resampling
di: Liu, Yujian, et al.
Pubblicazione: (2023)
di: Liu, Yujian, et al.
Pubblicazione: (2023)
Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit Difference
di: Ji, Jiabao, et al.
Pubblicazione: (2024)
di: Ji, Jiabao, et al.
Pubblicazione: (2024)
The Boy Who Survived: Removing Harry Potter from an LLM is harder than reported
di: Shostack, Adam
Pubblicazione: (2024)
di: Shostack, Adam
Pubblicazione: (2024)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
di: To, Bang Trinh Tran, et al.
Pubblicazione: (2025)
di: To, Bang Trinh Tran, et al.
Pubblicazione: (2025)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
di: An, Li, et al.
Pubblicazione: (2025)
di: An, Li, et al.
Pubblicazione: (2025)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
di: Hou, Bairu, et al.
Pubblicazione: (2023)
di: Hou, Bairu, et al.
Pubblicazione: (2023)
ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning
di: Hou, Bairu, et al.
Pubblicazione: (2025)
di: Hou, Bairu, et al.
Pubblicazione: (2025)
Augment before You Try: Knowledge-Enhanced Table Question Answering via Table Expansion
di: Liu, Yujian, et al.
Pubblicazione: (2024)
di: Liu, Yujian, et al.
Pubblicazione: (2024)
Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
di: Zhou, Cai, et al.
Pubblicazione: (2025)
di: Zhou, Cai, et al.
Pubblicazione: (2025)
Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond
di: Fan, Chongyu, et al.
Pubblicazione: (2025)
di: Fan, Chongyu, et al.
Pubblicazione: (2025)
Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
di: Zhou, Cai, et al.
Pubblicazione: (2025)
di: Zhou, Cai, et al.
Pubblicazione: (2025)
Effective Skill Unlearning through Intervention and Abstention
di: Li, Yongce, et al.
Pubblicazione: (2025)
di: Li, Yongce, et al.
Pubblicazione: (2025)
Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning
di: Chang, Hwan, et al.
Pubblicazione: (2025)
di: Chang, Hwan, et al.
Pubblicazione: (2025)
Conformal Language Modeling
di: Quach, Victor, et al.
Pubblicazione: (2023)
di: Quach, Victor, et al.
Pubblicazione: (2023)
UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targets
di: Wang, Wenyu, et al.
Pubblicazione: (2025)
di: Wang, Wenyu, et al.
Pubblicazione: (2025)
Think While You Generate: Discrete Diffusion with Planned Denoising
di: Liu, Sulin, et al.
Pubblicazione: (2024)
di: Liu, Sulin, et al.
Pubblicazione: (2024)
Towards Safer Large Language Models through Machine Unlearning
di: Liu, Zheyuan, et al.
Pubblicazione: (2024)
di: Liu, Zheyuan, et al.
Pubblicazione: (2024)
A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation
di: Hou, Bairu, et al.
Pubblicazione: (2024)
di: Hou, Bairu, et al.
Pubblicazione: (2024)
Activated Parameter Locating via Causal Intervention for Model Merging
di: Kong, Fanshuang, et al.
Pubblicazione: (2024)
di: Kong, Fanshuang, et al.
Pubblicazione: (2024)
UniErase: Towards Balanced and Precise Unlearning in Language Models
di: Yu, Miao, et al.
Pubblicazione: (2025)
di: Yu, Miao, et al.
Pubblicazione: (2025)
CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpad
di: Chen, Yongqiang, et al.
Pubblicazione: (2026)
di: Chen, Yongqiang, et al.
Pubblicazione: (2026)
Topic-aware Causal Intervention for Counterfactual Detection
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
MAAT: Multi-phase Adapter-Aware Targeted Unlearning
di: Yagnik, Suryash, et al.
Pubblicazione: (2026)
di: Yagnik, Suryash, et al.
Pubblicazione: (2026)
Revisiting Multimodal Emotion Recognition in Conversation from the Perspective of Graph Spectrum
di: Meng, Tao, et al.
Pubblicazione: (2024)
di: Meng, Tao, et al.
Pubblicazione: (2024)
iShumei-Chinchunmei at SemEval-2025 Task 4: A balanced forgetting and retention multi-task framework using effective unlearning loss
di: Sun, Yujian, et al.
Pubblicazione: (2025)
di: Sun, Yujian, et al.
Pubblicazione: (2025)
Causal Interventions on Causal Paths: Mapping GPT-2's Reasoning From Syntax to Semantics
di: Lee, Isabelle, et al.
Pubblicazione: (2024)
di: Lee, Isabelle, et al.
Pubblicazione: (2024)
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
di: Wan, Yixin, et al.
Pubblicazione: (2025)
di: Wan, Yixin, et al.
Pubblicazione: (2025)
Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?
di: Zhang, Qinyan, et al.
Pubblicazione: (2025)
di: Zhang, Qinyan, et al.
Pubblicazione: (2025)
Look Within, Why LLMs Hallucinate: A Causal Perspective
di: Li, He, et al.
Pubblicazione: (2024)
di: Li, He, et al.
Pubblicazione: (2024)
LEAPS: A discrete neural sampler via locally equivariant networks
di: Holderrieth, Peter, et al.
Pubblicazione: (2025)
di: Holderrieth, Peter, et al.
Pubblicazione: (2025)
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
di: Zhang, Yanan, et al.
Pubblicazione: (2024)
di: Zhang, Yanan, et al.
Pubblicazione: (2024)
Toward Understanding Unlearning Difficulty: A Mechanistic Perspective and Circuit-Guided Difficulty Metric
di: Cheng, Jiali, et al.
Pubblicazione: (2026)
di: Cheng, Jiali, et al.
Pubblicazione: (2026)
Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective
di: Chen, Boqi, et al.
Pubblicazione: (2026)
di: Chen, Boqi, et al.
Pubblicazione: (2026)
Re-TASK: Revisiting LLM Tasks from Capability, Skill, and Knowledge Perspectives
di: Wang, Zhihu, et al.
Pubblicazione: (2024)
di: Wang, Zhihu, et al.
Pubblicazione: (2024)
How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective
di: Qiu, Xinchi, et al.
Pubblicazione: (2024)
di: Qiu, Xinchi, et al.
Pubblicazione: (2024)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
di: Wang, Yian, et al.
Pubblicazione: (2026)
di: Wang, Yian, et al.
Pubblicazione: (2026)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Fictitious Synthetic Data Can Improve LLM Factuality via Prerequisite Learning
di: Liu, Yujian, et al.
Pubblicazione: (2024) -
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
di: Liu, Yujian, et al.
Pubblicazione: (2026) -
HarnessLLM: Automatic Testing Harness Generation via Reinforcement Learning
di: Liu, Yujian, et al.
Pubblicazione: (2025) -
Correcting Diffusion Generation through Resampling
di: Liu, Yujian, et al.
Pubblicazione: (2023) -
Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit Difference
di: Ji, Jiabao, et al.
Pubblicazione: (2024)