Auditing Language Model Unlearning via Information Decomposition
Fuente:
arXiv
Salvato in:
| Autori principali: | Goel, Anmol, Ritter, Alan, Gurevych, Iryna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Differentially Private Steering for Large Language Model Alignment
di: Goel, Anmol, et al.
Pubblicazione: (2025)
di: Goel, Anmol, et al.
Pubblicazione: (2025)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
How to Weight Multitask Finetuning? Fast Previews via Bayesian Model-Merging
di: Maldonado, Hugo Monzón, et al.
Pubblicazione: (2024)
di: Maldonado, Hugo Monzón, et al.
Pubblicazione: (2024)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
di: Daheim, Nico, et al.
Pubblicazione: (2024)
di: Daheim, Nico, et al.
Pubblicazione: (2024)
Auditing Approximate Machine Unlearning for Differentially Private Models
di: Gu, Yuechun, et al.
Pubblicazione: (2025)
di: Gu, Yuechun, et al.
Pubblicazione: (2025)
SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
Language Models can Self-Improve at State-Value Estimation for Better Search
di: Mendes, Ethan, et al.
Pubblicazione: (2025)
di: Mendes, Ethan, et al.
Pubblicazione: (2025)
Uncertainty-Aware Decoding with Minimum Bayes Risk
di: Daheim, Nico, et al.
Pubblicazione: (2025)
di: Daheim, Nico, et al.
Pubblicazione: (2025)
Anticipatory Evaluation of Language Models
di: Park, Jungsoo, et al.
Pubblicazione: (2025)
di: Park, Jungsoo, et al.
Pubblicazione: (2025)
Model Merging by Uncertainty-Based Gradient Matching
di: Daheim, Nico, et al.
Pubblicazione: (2023)
di: Daheim, Nico, et al.
Pubblicazione: (2023)
Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries
di: Li, Yanhang, et al.
Pubblicazione: (2026)
di: Li, Yanhang, et al.
Pubblicazione: (2026)
Towards Automated Error Discovery: A Study in Conversational AI
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
Unlearning Information Bottleneck: Machine Unlearning of Systematic Patterns and Biases
di: Han, Ling, et al.
Pubblicazione: (2024)
di: Han, Ling, et al.
Pubblicazione: (2024)
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
di: Naous, Tarek, et al.
Pubblicazione: (2023)
di: Naous, Tarek, et al.
Pubblicazione: (2023)
Didactic to Constructive: Turning Expert Solutions into Learnable Reasoning
di: Mendes, Ethan, et al.
Pubblicazione: (2026)
di: Mendes, Ethan, et al.
Pubblicazione: (2026)
MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors
di: Macina, Jakub, et al.
Pubblicazione: (2025)
di: Macina, Jakub, et al.
Pubblicazione: (2025)
Large Language Model Unlearning
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models
di: Li, Kunhao, et al.
Pubblicazione: (2025)
di: Li, Kunhao, et al.
Pubblicazione: (2025)
Large Language Model Unlearning via Embedding-Corrupted Prompts
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
Federated Knowledge Graph Unlearning via Diffusion Model
di: Liu, Bingchen, et al.
Pubblicazione: (2024)
di: Liu, Bingchen, et al.
Pubblicazione: (2024)
A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
di: Scholten, Yan, et al.
Pubblicazione: (2024)
di: Scholten, Yan, et al.
Pubblicazione: (2024)
SUA: Stealthy Multimodal Large Language Model Unlearning Attack
di: Zhang, Xianren, et al.
Pubblicazione: (2025)
di: Zhang, Xianren, et al.
Pubblicazione: (2025)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models
di: Tang, Haoyu, et al.
Pubblicazione: (2024)
di: Tang, Haoyu, et al.
Pubblicazione: (2024)
Unlearning via Sparse Representations
di: Shah, Vedant, et al.
Pubblicazione: (2023)
di: Shah, Vedant, et al.
Pubblicazione: (2023)
Governing AI Forgetting: Auditing for Machine Unlearning Compliance
di: Lin, Qinqi, et al.
Pubblicazione: (2026)
di: Lin, Qinqi, et al.
Pubblicazione: (2026)
An Information Theoretic Approach to Machine Unlearning
di: Foster, Jack, et al.
Pubblicazione: (2024)
di: Foster, Jack, et al.
Pubblicazione: (2024)
Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models
di: Sathyanarayanan, Anish, et al.
Pubblicazione: (2026)
di: Sathyanarayanan, Anish, et al.
Pubblicazione: (2026)
Machine Unlearning via Information Theoretic Regularization
di: Xu, Shizhou, et al.
Pubblicazione: (2025)
di: Xu, Shizhou, et al.
Pubblicazione: (2025)
Offset Unlearning for Large Language Models
di: Huang, James Y., et al.
Pubblicazione: (2024)
di: Huang, James Y., et al.
Pubblicazione: (2024)
Second-Order Information Matters: Revisiting Machine Unlearning for Large Language Models
di: Gu, Kang, et al.
Pubblicazione: (2024)
di: Gu, Kang, et al.
Pubblicazione: (2024)
MASEval: Extending Multi-Agent Evaluation from Models to Systems
di: Emde, Cornelius, et al.
Pubblicazione: (2026)
di: Emde, Cornelius, et al.
Pubblicazione: (2026)
A Survey of Machine Unlearning
di: Nguyen, Thanh Tam, et al.
Pubblicazione: (2022)
di: Nguyen, Thanh Tam, et al.
Pubblicazione: (2022)
Privacy Auditing of Large Language Models
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition
di: Lin, Shen, et al.
Pubblicazione: (2026)
di: Lin, Shen, et al.
Pubblicazione: (2026)
An Information Theoretic Evaluation Metric For Strong Unlearning
di: Jeon, Dongjae, et al.
Pubblicazione: (2024)
di: Jeon, Dongjae, et al.
Pubblicazione: (2024)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
di: Yang, Puning, et al.
Pubblicazione: (2026)
di: Yang, Puning, et al.
Pubblicazione: (2026)
GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models
di: Niu, Peizhi, et al.
Pubblicazione: (2025)
di: Niu, Peizhi, et al.
Pubblicazione: (2025)
Hierarchical Federated Unlearning for Large Language Models
di: Zhong, Yisheng, et al.
Pubblicazione: (2025)
di: Zhong, Yisheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Differentially Private Steering for Large Language Model Alignment
di: Goel, Anmol, et al.
Pubblicazione: (2025) -
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025) -
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024) -
How to Weight Multitask Finetuning? Fast Previews via Bayesian Model-Merging
di: Maldonado, Hugo Monzón, et al.
Pubblicazione: (2024) -
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
di: Daheim, Nico, et al.
Pubblicazione: (2024)