Kernelized Concept Erasure
Fuente:
arXiv
Salvato in:
| Autori principali: | Ravfogel, Shauli, Vargas, Francisco, Goldberg, Yoav, Cotterell, Ryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Linear Adversarial Concept Erasure
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
Log-linear Guardedness and its Implications
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022)
A Practical Method for Generating String Counterfactuals
di: Avitan, Matan, et al.
Pubblicazione: (2024)
di: Avitan, Matan, et al.
Pubblicazione: (2024)
BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models
di: Ben-Zaken, Elad, et al.
Pubblicazione: (2021)
di: Ben-Zaken, Elad, et al.
Pubblicazione: (2021)
Diversity Over Quantity: A Lesson From Few Shot Relation Classification
di: Cohen, Amir DN, et al.
Pubblicazione: (2024)
di: Cohen, Amir DN, et al.
Pubblicazione: (2024)
Gumbel Counterfactual Generation From Language Models
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
Description-Based Text Similarity
di: Ravfogel, Shauli, et al.
Pubblicazione: (2023)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2023)
Representation Surgery: Theory and Practice of Affine Steering
di: Singh, Shashwat, et al.
Pubblicazione: (2024)
di: Singh, Shashwat, et al.
Pubblicazione: (2024)
LEACE: Perfect linear concept erasure in closed form
di: Belrose, Nora, et al.
Pubblicazione: (2023)
di: Belrose, Nora, et al.
Pubblicazione: (2023)
State over Tokens: Characterizing the Role of Reasoning Tokens
di: Levy, Mosh, et al.
Pubblicazione: (2025)
di: Levy, Mosh, et al.
Pubblicazione: (2025)
Exploring the Linear Subspace Hypothesis in Gender Bias Mitigation
di: Vargas, Francisco, et al.
Pubblicazione: (2020)
di: Vargas, Francisco, et al.
Pubblicazione: (2020)
The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasure
di: Fan, Yu, et al.
Pubblicazione: (2025)
di: Fan, Yu, et al.
Pubblicazione: (2025)
On Affine Homotopy between Language Encoders
di: Chan, Robin SM, et al.
Pubblicazione: (2024)
di: Chan, Robin SM, et al.
Pubblicazione: (2024)
Preserving Task-Relevant Information Under Linear Concept Removal
di: Holstege, Floris, et al.
Pubblicazione: (2025)
di: Holstege, Floris, et al.
Pubblicazione: (2025)
The Role of Language Imbalance in Cross-lingual Generalisation: Insights from Cloned Language Experiments
di: Schäfer, Anton, et al.
Pubblicazione: (2024)
di: Schäfer, Anton, et al.
Pubblicazione: (2024)
Linguistic Binding in Diffusion Models: Enhancing Attribute Correspondence through Attention Map Alignment
di: Rassin, Royi, et al.
Pubblicazione: (2023)
di: Rassin, Royi, et al.
Pubblicazione: (2023)
PRISM: PRIor from corpus Statistics for topic Modeling
di: Ishon, Tal, et al.
Pubblicazione: (2026)
di: Ishon, Tal, et al.
Pubblicazione: (2026)
Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
di: Karvonen, Adam, et al.
Pubblicazione: (2024)
Nonlinear Concept Erasure: a Density Matching Approach
di: Saillenfest, Antoine, et al.
Pubblicazione: (2025)
di: Saillenfest, Antoine, et al.
Pubblicazione: (2025)
Transformers Can Represent $n$-gram Language Models
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
Compared to What? Baselines and Metrics for Counterfactual Prompting
di: Yang, Zihao, et al.
Pubblicazione: (2026)
di: Yang, Zihao, et al.
Pubblicazione: (2026)
An Algebraic View of the Expressivity of Recurrent Language Models
di: Nowak, Franz, et al.
Pubblicazione: (2026)
di: Nowak, Franz, et al.
Pubblicazione: (2026)
On the Representational Capacity of Recurrent Neural Language Models
di: Nowak, Franz, et al.
Pubblicazione: (2023)
di: Nowak, Franz, et al.
Pubblicazione: (2023)
What Do Language Models Learn in Context? The Structured Task Hypothesis
di: Li, Jiaoda, et al.
Pubblicazione: (2024)
di: Li, Jiaoda, et al.
Pubblicazione: (2024)
A Discriminative Latent-Variable Model for Bilingual Lexicon Induction
di: Ruder, Sebastian, et al.
Pubblicazione: (2018)
di: Ruder, Sebastian, et al.
Pubblicazione: (2018)
Better Estimation of the Kullback--Leibler Divergence Between Language Models
di: Amini, Afra, et al.
Pubblicazione: (2025)
di: Amini, Afra, et al.
Pubblicazione: (2025)
Direct Preference Optimization with an Offset
di: Amini, Afra, et al.
Pubblicazione: (2024)
di: Amini, Afra, et al.
Pubblicazione: (2024)
TaCo: Targeted Concept Erasure Prevents Non-Linear Classifiers From Detecting Protected Attributes
di: Jourdan, Fanny, et al.
Pubblicazione: (2023)
di: Jourdan, Fanny, et al.
Pubblicazione: (2023)
On the Role of Context in Reading Time Prediction
di: Opedal, Andreas, et al.
Pubblicazione: (2024)
di: Opedal, Andreas, et al.
Pubblicazione: (2024)
On Efficiently Representing Regular Languages as RNNs
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
GRADE: Quantifying Sample Diversity in Text-to-Image Models
di: Rassin, Royi, et al.
Pubblicazione: (2024)
di: Rassin, Royi, et al.
Pubblicazione: (2024)
Can Language Models Learn Typologically Implausible Languages?
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
Geometric Factual Recall in Transformers
di: Ravfogel, Shauli, et al.
Pubblicazione: (2026)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2026)
Unique Hard Attention: A Tale of Two Sides
di: Jerad, Selim, et al.
Pubblicazione: (2025)
di: Jerad, Selim, et al.
Pubblicazione: (2025)
Syntactic Control of Language Models by Posterior Inference
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
Variational Best-of-N Alignment
di: Amini, Afra, et al.
Pubblicazione: (2024)
di: Amini, Afra, et al.
Pubblicazione: (2024)
Discrete Diffusion Models Exploit Asymmetry to Solve Lookahead Planning Tasks
di: Trainin, Itamar, et al.
Pubblicazione: (2026)
di: Trainin, Itamar, et al.
Pubblicazione: (2026)
CRCE: Coreference-Retention Concept Erasure in Text-to-Image Diffusion Models
di: Xue, Yuyang, et al.
Pubblicazione: (2025)
di: Xue, Yuyang, et al.
Pubblicazione: (2025)
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
di: Svete, Anej, et al.
Pubblicazione: (2026)
di: Svete, Anej, et al.
Pubblicazione: (2026)
Training Neural Networks as Recognizers of Formal Languages
di: Butoi, Alexandra, et al.
Pubblicazione: (2024)
di: Butoi, Alexandra, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Linear Adversarial Concept Erasure
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022) -
Log-linear Guardedness and its Implications
di: Ravfogel, Shauli, et al.
Pubblicazione: (2022) -
A Practical Method for Generating String Counterfactuals
di: Avitan, Matan, et al.
Pubblicazione: (2024) -
BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models
di: Ben-Zaken, Elad, et al.
Pubblicazione: (2021) -
Diversity Over Quantity: A Lesson From Few Shot Relation Classification
di: Cohen, Amir DN, et al.
Pubblicazione: (2024)