LUME: LLM Unlearning with Multitask Evaluations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ramakrishna, Anil, Wan, Yixin, Jin, Xiaomeng, Chang, Kai-Wei, Bu, Zhiqi, Vinzamuri, Bhanukiran, Cevher, Volkan, Hong, Mingyi, Gupta, Rahul |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models
par: Ramakrishna, Anil, et autres
Publié: (2025)
par: Ramakrishna, Anil, et autres
Publié: (2025)
Unlearning as multi-task optimization: A normalized gradient difference approach with an adaptive learning rate
par: Bu, Zhiqi, et autres
Publié: (2024)
par: Bu, Zhiqi, et autres
Publié: (2024)
BLUR: A Bi-Level Optimization Approach for LLM Unlearning
par: Reisizadeh, Hadi, et autres
Publié: (2025)
par: Reisizadeh, Hadi, et autres
Publié: (2025)
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond
par: Fan, Chongyu, et autres
Publié: (2025)
par: Fan, Chongyu, et autres
Publié: (2025)
Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks
par: Cheng, Yixin, et autres
Publié: (2024)
par: Cheng, Yixin, et autres
Publié: (2024)
Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning
par: Xie, Wanyun, et autres
Publié: (2025)
par: Xie, Wanyun, et autres
Publié: (2025)
Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification
par: Meng, Tao, et autres
Publié: (2024)
par: Meng, Tao, et autres
Publié: (2024)
White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
par: Kumarage, Tharindu, et autres
Publié: (2025)
par: Kumarage, Tharindu, et autres
Publié: (2025)
ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining
par: Bal, Melis Ilayda, et autres
Publié: (2025)
par: Bal, Melis Ilayda, et autres
Publié: (2025)
Constrained Entropic Unlearning: A Primal-Dual Framework for Large Language Models
par: Entesari, Taha, et autres
Publié: (2025)
par: Entesari, Taha, et autres
Publié: (2025)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
par: Mushtaq, Erum, et autres
Publié: (2025)
par: Mushtaq, Erum, et autres
Publié: (2025)
InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval
par: Wu, Di, et autres
Publié: (2025)
par: Wu, Di, et autres
Publié: (2025)
Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning
par: Sarkar, Soumajyoti, et autres
Publié: (2024)
par: Sarkar, Soumajyoti, et autres
Publié: (2024)
Certified Robustness Under Bounded Levenshtein Distance
par: Rocamora, Elias Abad, et autres
Publié: (2025)
par: Rocamora, Elias Abad, et autres
Publié: (2025)
Easy Data Unlearning Bench
par: Rinberg, Roy, et autres
Publié: (2026)
par: Rinberg, Roy, et autres
Publié: (2026)
SWAN: Semantic Watermarking with Abstract Meaning Representation
par: Ye, Ziping, et autres
Publié: (2026)
par: Ye, Ziping, et autres
Publié: (2026)
Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning
par: Chang, Hwan, et autres
Publié: (2025)
par: Chang, Hwan, et autres
Publié: (2025)
GRASP: Deterministic argument ranking in interaction graphs
par: Misra, Diganta, et autres
Publié: (2026)
par: Misra, Diganta, et autres
Publié: (2026)
Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
par: Doshi, Jai, et autres
Publié: (2024)
par: Doshi, Jai, et autres
Publié: (2024)
Extreme Miscalibration and the Illusion of Adversarial Robustness
par: Raina, Vyas, et autres
Publié: (2024)
par: Raina, Vyas, et autres
Publié: (2024)
Explaining and Improving Contrastive Decoding by Extrapolating the Probabilities of a Huge and Hypothetical LM
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs
par: Zhang, Yidan, et autres
Publié: (2024)
par: Zhang, Yidan, et autres
Publié: (2024)
Gradient descent with generalized Newton's method
par: Bu, Zhiqi, et autres
Publié: (2024)
par: Bu, Zhiqi, et autres
Publié: (2024)
Selective Rotary Position Embedding
par: Movahedi, Sajad, et autres
Publié: (2025)
par: Movahedi, Sajad, et autres
Publié: (2025)
Towards hyperparameter-free optimization with differential privacy
par: Bu, Zhiqi, et autres
Publié: (2025)
par: Bu, Zhiqi, et autres
Publié: (2025)
Where Fact Ends and Fairness Begins: Redefining AI Bias Evaluation through Cognitive Biases
par: Huang, Jen-tse, et autres
Publié: (2025)
par: Huang, Jen-tse, et autres
Publié: (2025)
REAL Sampling: Boosting Factuality and Diversity of Open-Ended Generation via Asymptotic Entropy
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
The Factuality Tax of Diversity-Intervened Text-to-Image Generation: Benchmark and Fact-Augmented Intervention
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
par: Chang, Jiayi, et autres
Publié: (2025)
par: Chang, Jiayi, et autres
Publié: (2025)
DOPPLER: Differentially Private Optimizers with Low-pass Filter for Privacy Noise Reduction
par: Zhang, Xinwei, et autres
Publié: (2024)
par: Zhang, Xinwei, et autres
Publié: (2024)
Krylov Cubic Regularized Newton: A Subspace Second-Order Method with Dimension-Free Convergence Rate
par: Jiang, Ruichen, et autres
Publié: (2024)
par: Jiang, Ruichen, et autres
Publié: (2024)
Revisiting Character-level Adversarial Attacks for Language Models
par: Rocamora, Elias Abad, et autres
Publié: (2024)
par: Rocamora, Elias Abad, et autres
Publié: (2024)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
par: Spohn, Philipp, et autres
Publié: (2025)
par: Spohn, Philipp, et autres
Publié: (2025)
Convex Dominance in Deep Learning I: A Scaling Law of Loss and Learning Rate
par: Bu, Zhiqi, et autres
Publié: (2026)
par: Bu, Zhiqi, et autres
Publié: (2026)
LLM Unlearning with LLM Beliefs
par: Li, Kemou, et autres
Publié: (2025)
par: Li, Kemou, et autres
Publié: (2025)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
par: Yang, Zhengbang, et autres
Publié: (2026)
par: Yang, Zhengbang, et autres
Publié: (2026)
Documents similaires
-
SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models
par: Ramakrishna, Anil, et autres
Publié: (2025) -
Unlearning as multi-task optimization: A normalized gradient difference approach with an adaptive learning rate
par: Bu, Zhiqi, et autres
Publié: (2024) -
BLUR: A Bi-Level Optimization Approach for LLM Unlearning
par: Reisizadeh, Hadi, et autres
Publié: (2025) -
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
par: Wan, Yixin, et autres
Publié: (2025) -
Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond
par: Fan, Chongyu, et autres
Publié: (2025)