Fundamental Limits of Perfect Concept Erasure
Fuente:
arXiv
Salvato in:
| Autori principali: | Chowdhury, Somnath Basu Roy, Dubey, Avinava, Beirami, Ahmad, Kidambi, Rahul, Monath, Nicholas, Ahmed, Amr, Chaturvedi, Snigdha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Group Fairness in Online Settings Using Oblique Decision Forests
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2023)
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2023)
Incremental Extractive Opinion Summarization Using Cover Trees
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2024)
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2024)
Towards Scalable Exact Machine Unlearning Using Parameter-Efficient Fine-Tuning
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2024)
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2024)
Inference-time Unlearning Using Conformal Prediction
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2026)
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2026)
Fast Tree-Field Integrators: From Low Displacement Rank to Topological Transformers
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2024)
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2024)
EUGens: Efficient, Unified, and General Dense Layers
di: Kim, Sang Min, et al.
Pubblicazione: (2026)
di: Kim, Sang Min, et al.
Pubblicazione: (2026)
Structured Unrestricted-Rank Matrices for Parameter Efficient Fine-tuning
di: Sehanobish, Arijit, et al.
Pubblicazione: (2024)
di: Sehanobish, Arijit, et al.
Pubblicazione: (2024)
EUGens: Efficient, Unified, and General Dense Layers
di: Kim, Sang Min, et al.
Pubblicazione: (2024)
di: Kim, Sang Min, et al.
Pubblicazione: (2024)
Exploring Safety-Utility Trade-Offs in Personalized Language Models
di: Vijjini, Anvesh Rao, et al.
Pubblicazione: (2024)
di: Vijjini, Anvesh Rao, et al.
Pubblicazione: (2024)
Computationally-efficient Graph Modeling with Refined Graph Random Features
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2025)
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2025)
Optimal Time Complexity Algorithms for Computing General Random Walk Graph Kernels on Sparse Graphs
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2024)
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2024)
Kernelized Concept Erasure
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
SWING: Unlocking Implicit Graph Representations for Graph Random Features
di: Manenti, Alessandro, et al.
Pubblicazione: (2026)
di: Manenti, Alessandro, et al.
Pubblicazione: (2026)
Linear Adversarial Concept Erasure
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
RelFlexformer: Efficient Attention 3D-Transformers for Integrable Relative Positional Encodings
di: Kim, Byeongchan, et al.
Pubblicazione: (2026)
di: Kim, Byeongchan, et al.
Pubblicazione: (2026)
Auctions with LLM Summaries
di: Dubey, Kumar Avinava, et al.
Pubblicazione: (2024)
di: Dubey, Kumar Avinava, et al.
Pubblicazione: (2024)
Scalable Neural Network Kernels
di: Sehanobish, Arijit, et al.
Pubblicazione: (2023)
di: Sehanobish, Arijit, et al.
Pubblicazione: (2023)
Obliviator Reveals the Cost of Nonlinear Guardedness in Concept Erasure
di: Akbari, Ramin, et al.
Pubblicazione: (2026)
di: Akbari, Ramin, et al.
Pubblicazione: (2026)
Cross-Layer Subspace Coupling for LLM Compression: A Unifying Framework and Its Empirical Limits
di: Khilar, Snigdha Chandan
Pubblicazione: (2026)
di: Khilar, Snigdha Chandan
Pubblicazione: (2026)
Minimalist Concept Erasure in Generative Models
di: Zhang, Yang, et al.
Pubblicazione: (2025)
di: Zhang, Yang, et al.
Pubblicazione: (2025)
Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
Nonlinear Concept Erasure: a Density Matching Approach
di: Saillenfest, Antoine, et al.
Pubblicazione: (2025)
di: Saillenfest, Antoine, et al.
Pubblicazione: (2025)
Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
Closed-Form Concept Erasure via Double Projections
di: Zhang, Chi, et al.
Pubblicazione: (2026)
di: Zhang, Chi, et al.
Pubblicazione: (2026)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
di: Swamy, Gokul, et al.
Pubblicazione: (2024)
A Fresh Take on Stale Embeddings: Improving Dense Retriever Training with Corrector Networks
di: Monath, Nicholas, et al.
Pubblicazione: (2024)
di: Monath, Nicholas, et al.
Pubblicazione: (2024)
TaCo: Targeted Concept Erasure Prevents Non-Linear Classifiers From Detecting Protected Attributes
di: Jourdan, Fanny, et al.
Pubblicazione: (2023)
di: Jourdan, Fanny, et al.
Pubblicazione: (2023)
Adaptive Retrieval and Scalable Indexing for k-NN Search with Cross-Encoders
di: Yadav, Nishant, et al.
Pubblicazione: (2024)
di: Yadav, Nishant, et al.
Pubblicazione: (2024)
MarginSel : Max-Margin Demonstration Selection for LLMs
di: Ambati, Rajeev Bhatt, et al.
Pubblicazione: (2025)
di: Ambati, Rajeev Bhatt, et al.
Pubblicazione: (2025)
Rethinking the Vulnerability of Concept Erasure and a New Method
di: Richardson, Alex D., et al.
Pubblicazione: (2025)
di: Richardson, Alex D., et al.
Pubblicazione: (2025)
Erased but Not Forgotten: How Backdoors Compromise Concept Erasure
di: Braun, Tobias, et al.
Pubblicazione: (2025)
di: Braun, Tobias, et al.
Pubblicazione: (2025)
Separable Multi-Concept Erasure from Diffusion Models
di: Zhao, Mengnan, et al.
Pubblicazione: (2024)
di: Zhao, Mengnan, et al.
Pubblicazione: (2024)
TraSCE: Trajectory Steering for Concept Erasure
di: Jain, Anubhav, et al.
Pubblicazione: (2024)
di: Jain, Anubhav, et al.
Pubblicazione: (2024)
MACE: Mass Concept Erasure in Diffusion Models
di: Lu, Shilin, et al.
Pubblicazione: (2024)
di: Lu, Shilin, et al.
Pubblicazione: (2024)
Improving Robustness via Tilted Exponential Layer: A Communication-Theoretic Perspective
di: Puranik, Bhagyashree, et al.
Pubblicazione: (2023)
di: Puranik, Bhagyashree, et al.
Pubblicazione: (2023)
Fundamental Limits of Neural Network Sparsification: Evidence from Catastrophic Interpretability Collapse
di: Roy, Dip, et al.
Pubblicazione: (2026)
di: Roy, Dip, et al.
Pubblicazione: (2026)
Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models
di: Novello, Nicola, et al.
Pubblicazione: (2026)
di: Novello, Nicola, et al.
Pubblicazione: (2026)
Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis
di: Aminian, Gholamali, et al.
Pubblicazione: (2025)
di: Aminian, Gholamali, et al.
Pubblicazione: (2025)
Linear Transformer Topological Masking with Graph Random Features
di: Reid, Isaac, et al.
Pubblicazione: (2024)
di: Reid, Isaac, et al.
Pubblicazione: (2024)
Learning Semantic Structure through First-Order-Logic Translation
di: Chaturvedi, Akshay, et al.
Pubblicazione: (2024)
di: Chaturvedi, Akshay, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Enhancing Group Fairness in Online Settings Using Oblique Decision Forests
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2023) -
Incremental Extractive Opinion Summarization Using Cover Trees
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2024) -
Towards Scalable Exact Machine Unlearning Using Parameter-Efficient Fine-Tuning
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2024) -
Inference-time Unlearning Using Conformal Prediction
di: Chowdhury, Somnath Basu Roy, et al.
Pubblicazione: (2026) -
Fast Tree-Field Integrators: From Low Displacement Rank to Topological Transformers
di: Choromanski, Krzysztof, et al.
Pubblicazione: (2024)