Detoxifying LLMs via Representation Erasure-Based Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Sepahvand, Nazanin Mohammadi, Triantafillou, Eleni, Larochelle, Hugo, Precup, Doina, Roy, Daniel M., Dziugaite, Gintare Karolina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Data Selection for Transfer Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2024)
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2024)
Leveraging Per-Instance Privacy for Machine Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2025)
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2025)
Improved Localized Machine Unlearning Through the Lens of Memorization
di: Torkzadehmahani, Reihaneh, et al.
Pubblicazione: (2024)
di: Torkzadehmahani, Reihaneh, et al.
Pubblicazione: (2024)
The Non-Local Model Merging Problem: Permutation Symmetries and Variance Collapse
di: Sharma, Ekansh, et al.
Pubblicazione: (2024)
di: Sharma, Ekansh, et al.
Pubblicazione: (2024)
Information Complexity of Stochastic Convex Optimization: Applications to Generalization and Memorization
di: Attias, Idan, et al.
Pubblicazione: (2024)
di: Attias, Idan, et al.
Pubblicazione: (2024)
From Dormant to Deleted: Tamper-Resistant Unlearning Through Weight-Space Regularization
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2025)
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2025)
Unlearning in- vs. out-of-distribution data in LLMs under gradient-based method
di: Baluta, Teodora, et al.
Pubblicazione: (2024)
di: Baluta, Teodora, et al.
Pubblicazione: (2024)
On Traceability in $\ell_p$ Stochastic Convex Optimization
di: Voitovych, Sasha, et al.
Pubblicazione: (2025)
di: Voitovych, Sasha, et al.
Pubblicazione: (2025)
Mixtures of Experts Unlock Parameter Scaling for Deep RL
di: Obando-Ceron, Johan, et al.
Pubblicazione: (2024)
di: Obando-Ceron, Johan, et al.
Pubblicazione: (2024)
Simultaneous linear connectivity of neural networks modulo permutation
di: Sharma, Ekansh, et al.
Pubblicazione: (2024)
di: Sharma, Ekansh, et al.
Pubblicazione: (2024)
Less is More: Undertraining Experts Improves Model Upcycling
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
di: Guo, Phillip, et al.
Pubblicazione: (2024)
di: Guo, Phillip, et al.
Pubblicazione: (2024)
Capturing Individual Human Preferences with Reward Features
di: Barreto, André, et al.
Pubblicazione: (2025)
di: Barreto, André, et al.
Pubblicazione: (2025)
Identifying Spurious Biases Early in Training through the Lens of Simplicity Bias
di: Yang, Yu, et al.
Pubblicazione: (2023)
di: Yang, Yu, et al.
Pubblicazione: (2023)
Conditions on Preference Relations that Guarantee the Existence of Optimal Policies
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023)
Leveraging Function Space Aggregation for Federated Learning at Scale
di: Dhawan, Nikita, et al.
Pubblicazione: (2023)
di: Dhawan, Nikita, et al.
Pubblicazione: (2023)
Dataset Difficulty and the Role of Inductive Bias
di: Kwok, Devin, et al.
Pubblicazione: (2024)
di: Kwok, Devin, et al.
Pubblicazione: (2024)
A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings
di: Alver, Safa, et al.
Pubblicazione: (2022)
di: Alver, Safa, et al.
Pubblicazione: (2022)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
Soup to go: mitigating forgetting during continual learning with model averaging
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
Are we making progress in unlearning? Findings from the first NeurIPS unlearning competition
di: Triantafillou, Eleni, et al.
Pubblicazione: (2024)
di: Triantafillou, Eleni, et al.
Pubblicazione: (2024)
Diversity-Enriched Option-Critic
di: Kamat, Anand, et al.
Pubblicazione: (2020)
di: Kamat, Anand, et al.
Pubblicazione: (2020)
Functional Acceleration for Policy Mirror Descent
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
Incorporating Spatial Information into Goal-Conditioned Hierarchical Reinforcement Learning via Graph Representations
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
Continual Learning in Vision-Language Models via Aligned Model Merging
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
Balancing Plasticity and Stability with Fast and Slow Successor Features
di: Chua, Raymond, et al.
Pubblicazione: (2026)
di: Chua, Raymond, et al.
Pubblicazione: (2026)
Partial Models for Building Adaptive Model-Based Reinforcement Learning Agents
di: Alver, Safa, et al.
Pubblicazione: (2024)
di: Alver, Safa, et al.
Pubblicazione: (2024)
SSFL: Discovering Sparse Unified Subnetworks at Initialization for Efficient Federated Learning
di: Ohib, Riyasat, et al.
Pubblicazione: (2024)
di: Ohib, Riyasat, et al.
Pubblicazione: (2024)
On the Privacy of Selection Mechanisms with Gaussian Noise
di: Lebensold, Jonathan, et al.
Pubblicazione: (2024)
di: Lebensold, Jonathan, et al.
Pubblicazione: (2024)
What makes unlearning hard and what to do about it
di: Zhao, Kairan, et al.
Pubblicazione: (2024)
di: Zhao, Kairan, et al.
Pubblicazione: (2024)
The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws
di: Jin, Tian, et al.
Pubblicazione: (2025)
di: Jin, Tian, et al.
Pubblicazione: (2025)
Torque-Aware Momentum
di: Malviya, Pranshu, et al.
Pubblicazione: (2024)
di: Malviya, Pranshu, et al.
Pubblicazione: (2024)
Sparse-Reg: Improving Sample Complexity in Offline Reinforcement Learning using Sparsity
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
Relative Trajectory Balance is equivalent to Trust-PCL
di: Deleu, Tristan, et al.
Pubblicazione: (2025)
di: Deleu, Tristan, et al.
Pubblicazione: (2025)
Capacity-Constrained Continual Learning
di: Wen, Zheng, et al.
Pubblicazione: (2025)
di: Wen, Zheng, et al.
Pubblicazione: (2025)
Fluid-Agent Reinforcement Learning
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
Langevin Soft Actor-Critic: Efficient Exploration through Uncertainty-Driven Critic Learning
di: Ishfaq, Haque, et al.
Pubblicazione: (2025)
di: Ishfaq, Haque, et al.
Pubblicazione: (2025)
Offline Multitask Representation Learning for Reinforcement Learning
di: Ishfaq, Haque, et al.
Pubblicazione: (2024)
di: Ishfaq, Haque, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Data Selection for Transfer Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2024) -
Leveraging Per-Instance Privacy for Machine Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2025) -
Improved Localized Machine Unlearning Through the Lens of Memorization
di: Torkzadehmahani, Reihaneh, et al.
Pubblicazione: (2024) -
The Non-Local Model Merging Problem: Permutation Symmetries and Variance Collapse
di: Sharma, Ekansh, et al.
Pubblicazione: (2024) -
Information Complexity of Stochastic Convex Optimization: Applications to Generalization and Memorization
di: Attias, Idan, et al.
Pubblicazione: (2024)