Circuit Breaking: Removing Model Behaviors with Targeted Ablation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Maximilian, Davies, Xander, Nadeau, Max |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Breaking BERT: Gradient Attack on Twitter Sentiment Analysis for Targeted Misclassification
di: Subedi, Akil Raj, et al.
Pubblicazione: (2025)
di: Subedi, Akil Raj, et al.
Pubblicazione: (2025)
Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
di: Liu, Hongliang, et al.
Pubblicazione: (2026)
di: Liu, Hongliang, et al.
Pubblicazione: (2026)
Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs
di: Hatefi, Sayed Mohammad Vakilzadeh, et al.
Pubblicazione: (2025)
di: Hatefi, Sayed Mohammad Vakilzadeh, et al.
Pubblicazione: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Scalable Data Ablation Approximations for Language Models through Modular Training and Merging
di: Na, Clara, et al.
Pubblicazione: (2024)
di: Na, Clara, et al.
Pubblicazione: (2024)
PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
di: Coalson, Zachary, et al.
Pubblicazione: (2024)
di: Coalson, Zachary, et al.
Pubblicazione: (2024)
Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models
di: Kreutner, Maximilian, et al.
Pubblicazione: (2025)
di: Kreutner, Maximilian, et al.
Pubblicazione: (2025)
Breaking the Attention Bottleneck
di: Hilsenbek, Kalle
Pubblicazione: (2024)
di: Hilsenbek, Kalle
Pubblicazione: (2024)
Judge Circuits
di: Feldhus, Nils, et al.
Pubblicazione: (2026)
di: Feldhus, Nils, et al.
Pubblicazione: (2026)
Cyclic Ablation: Testing Concept Localization against Functional Regeneration in AI
di: Kapelko, Eduard
Pubblicazione: (2025)
di: Kapelko, Eduard
Pubblicazione: (2025)
Circuit Component Reuse Across Tasks in Transformer Language Models
di: Merullo, Jack, et al.
Pubblicazione: (2023)
di: Merullo, Jack, et al.
Pubblicazione: (2023)
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
di: Lochab, Anamika, et al.
Pubblicazione: (2026)
di: Lochab, Anamika, et al.
Pubblicazione: (2026)
Circuit Compositions: Exploring Modular Structures in Transformer-Based Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Sparse Autoencoders Enable Scalable and Reliable Circuit Identification in Language Models
di: O'Neill, Charles, et al.
Pubblicazione: (2024)
di: O'Neill, Charles, et al.
Pubblicazione: (2024)
Discursive Circuits: How Do Language Models Understand Discourse Relations?
di: Miao, Yisong, et al.
Pubblicazione: (2025)
di: Miao, Yisong, et al.
Pubblicazione: (2025)
Breaking Symmetry When Training Transformers
di: Zuo, Chunsheng, et al.
Pubblicazione: (2024)
di: Zuo, Chunsheng, et al.
Pubblicazione: (2024)
Functional Component Ablation Reveals Specialization Patterns in Hybrid Language Model Architectures
di: Borobia, Hector, et al.
Pubblicazione: (2026)
di: Borobia, Hector, et al.
Pubblicazione: (2026)
STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs
di: Dong, Peijie, et al.
Pubblicazione: (2024)
di: Dong, Peijie, et al.
Pubblicazione: (2024)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
di: Li, Zongqian, et al.
Pubblicazione: (2026)
di: Li, Zongqian, et al.
Pubblicazione: (2026)
Circuit Complexity Bounds for Visual Autoregressive Model
di: Ke, Yekun, et al.
Pubblicazione: (2025)
di: Ke, Yekun, et al.
Pubblicazione: (2025)
Single Character Perturbations Break LLM Alignment
di: Lin, Leon, et al.
Pubblicazione: (2024)
di: Lin, Leon, et al.
Pubblicazione: (2024)
Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models
di: Ruis, Laura, et al.
Pubblicazione: (2024)
di: Ruis, Laura, et al.
Pubblicazione: (2024)
On Mechanistic Circuits for Extractive Question-Answering
di: Basu, Samyadeep, et al.
Pubblicazione: (2025)
di: Basu, Samyadeep, et al.
Pubblicazione: (2025)
Language Models Improve When Pretraining Data Matches Target Tasks
di: Mizrahi, David, et al.
Pubblicazione: (2025)
di: Mizrahi, David, et al.
Pubblicazione: (2025)
Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
di: Guan, Zihan, et al.
Pubblicazione: (2025)
di: Guan, Zihan, et al.
Pubblicazione: (2025)
Adaptive Circuit Behavior and Generalization in Mechanistic Interpretability
di: Nainani, Jatin, et al.
Pubblicazione: (2024)
di: Nainani, Jatin, et al.
Pubblicazione: (2024)
GenFighter: A Generative and Evolutive Textual Attack Removal
di: Islam, Md Athikul, et al.
Pubblicazione: (2024)
di: Islam, Md Athikul, et al.
Pubblicazione: (2024)
Transcoders Find Interpretable LLM Feature Circuits
di: Dunefsky, Jacob, et al.
Pubblicazione: (2024)
di: Dunefsky, Jacob, et al.
Pubblicazione: (2024)
Does Alignment Tuning Really Break LLMs' Internal Confidence?
di: Oh, Hongseok, et al.
Pubblicazione: (2024)
di: Oh, Hongseok, et al.
Pubblicazione: (2024)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
di: Fu, Yichao, et al.
Pubblicazione: (2024)
di: Fu, Yichao, et al.
Pubblicazione: (2024)
Breaking MLPerf Training: A Case Study on Optimizing BERT
di: Kim, Yongdeok, et al.
Pubblicazione: (2024)
di: Kim, Yongdeok, et al.
Pubblicazione: (2024)
Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2025)
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2025)
LLM Circuit Analyses Are Consistent Across Training and Scale
di: Tigges, Curt, et al.
Pubblicazione: (2024)
di: Tigges, Curt, et al.
Pubblicazione: (2024)
Identifying a Circuit for Verb Conjugation in GPT-2
di: Africa, David Demitri
Pubblicazione: (2025)
di: Africa, David Demitri
Pubblicazione: (2025)
$K$-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks
di: Chowdhary, Pratim, et al.
Pubblicazione: (2025)
di: Chowdhary, Pratim, et al.
Pubblicazione: (2025)
Foundation Model's Embedded Representations May Detect Distribution Shift
di: Vargas, Max, et al.
Pubblicazione: (2023)
di: Vargas, Max, et al.
Pubblicazione: (2023)
Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation
di: Miandoab, Kaveh Eskandari, et al.
Pubblicazione: (2025)
di: Miandoab, Kaveh Eskandari, et al.
Pubblicazione: (2025)
What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
di: Jain, Samyak, et al.
Pubblicazione: (2024)
di: Jain, Samyak, et al.
Pubblicazione: (2024)
SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning
di: Yu, Qifan, et al.
Pubblicazione: (2026)
di: Yu, Qifan, et al.
Pubblicazione: (2026)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Breaking BERT: Gradient Attack on Twitter Sentiment Analysis for Targeted Misclassification
di: Subedi, Akil Raj, et al.
Pubblicazione: (2025) -
Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
di: Liu, Hongliang, et al.
Pubblicazione: (2026) -
Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs
di: Hatefi, Sayed Mohammad Vakilzadeh, et al.
Pubblicazione: (2025) -
Existing Large Language Model Unlearning Evaluations Are Inconclusive
di: Feng, Zhili, et al.
Pubblicazione: (2025) -
Scalable Data Ablation Approximations for Language Models through Modular Training and Merging
di: Na, Clara, et al.
Pubblicazione: (2024)