SAKE: Steering Activations for Knowledge Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Scialanga, Marco, Laugel, Thibault, Grari, Vincent, Detyniecki, Marcin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Post-processing fairness with minimal changes
par: Di Gennaro, Federico, et autres
Publié: (2024)
par: Di Gennaro, Federico, et autres
Publié: (2024)
OptiGrad: A Fair and more Efficient Price Elasticity Optimization via a Gradient Based Learning
par: Grari, Vincent, et autres
Publié: (2024)
par: Grari, Vincent, et autres
Publié: (2024)
ACT: Agentic Classification Tree
par: Grari, Vincent, et autres
Publié: (2025)
par: Grari, Vincent, et autres
Publié: (2025)
Agentic Adversarial QA for Improving Domain-Specific LLMs
par: Grari, Vincent, et autres
Publié: (2026)
par: Grari, Vincent, et autres
Publié: (2026)
Understanding Prediction Discrepancies in Machine Learning Classifiers
par: Renard, Xavier, et autres
Publié: (2021)
par: Renard, Xavier, et autres
Publié: (2021)
Controlled Model Debiasing through Minimal and Interpretable Updates
par: Di Gennaro, Federico, et autres
Publié: (2025)
par: Di Gennaro, Federico, et autres
Publié: (2025)
When mitigating bias is unfair: multiplicity and arbitrariness in algorithmic group fairness
par: Krco, Natasa, et autres
Publié: (2023)
par: Krco, Natasa, et autres
Publié: (2023)
Why do explanations fail? A typology and discussion on failures in XAI
par: Bove, Clara, et autres
Publié: (2024)
par: Bove, Clara, et autres
Publié: (2024)
From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes
par: Garzón, Rubén, et autres
Publié: (2026)
par: Garzón, Rubén, et autres
Publié: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026)
par: Heyman, Geert, et autres
Publié: (2026)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
Endogenous Resistance to Activation Steering in Language Models
par: McKenzie, Alex, et autres
Publié: (2026)
par: McKenzie, Alex, et autres
Publié: (2026)
Extracting Unlearned Information from LLMs with Activation Steering
par: Seyitoğlu, Atakan, et autres
Publié: (2024)
par: Seyitoğlu, Atakan, et autres
Publié: (2024)
Steering Llama 2 via Contrastive Activation Addition
par: Panickssery, Nina, et autres
Publié: (2023)
par: Panickssery, Nina, et autres
Publié: (2023)
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Model Merging for Knowledge Editing
par: Fu, Zichuan, et autres
Publié: (2025)
par: Fu, Zichuan, et autres
Publié: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering
par: Bigelow, Eric, et autres
Publié: (2025)
par: Bigelow, Eric, et autres
Publié: (2025)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
par: Soo, Samuel, et autres
Publié: (2025)
par: Soo, Samuel, et autres
Publié: (2025)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
par: Scalena, Daniel, et autres
Publié: (2024)
par: Scalena, Daniel, et autres
Publié: (2024)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
par: Anand, Nikhil, et autres
Publié: (2026)
par: Anand, Nikhil, et autres
Publié: (2026)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Spectral Editing of Activations for Large Language Model Alignment
par: Qiu, Yifu, et autres
Publié: (2024)
par: Qiu, Yifu, et autres
Publié: (2024)
Extending Activation Steering to Broad Skills and Multiple Behaviours
par: van der Weij, Teun, et autres
Publié: (2024)
par: van der Weij, Teun, et autres
Publié: (2024)
Joint Localization and Activation Editing for Low-Resource Fine-Tuning
par: Lai, Wen, et autres
Publié: (2025)
par: Lai, Wen, et autres
Publié: (2025)
FLEKE: Federated Locate-then-Edit Knowledge Editing
par: Zhao, Zongkai, et autres
Publié: (2025)
par: Zhao, Zongkai, et autres
Publié: (2025)
Lifelong Knowledge Editing requires Better Regularization
par: Gupta, Akshat, et autres
Publié: (2025)
par: Gupta, Akshat, et autres
Publié: (2025)
That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation
par: Bae, Jaesung, et autres
Publié: (2025)
par: Bae, Jaesung, et autres
Publié: (2025)
COMPKE: Complex Question Answering under Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
Knowledge Editing on Black-box Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2024)
par: Song, Xiaoshuai, et autres
Publié: (2024)
Time Sensitive Knowledge Editing through Efficient Finetuning
par: Ge, Xiou, et autres
Publié: (2024)
par: Ge, Xiou, et autres
Publié: (2024)
Multi-hop Question Answering under Temporal Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2024)
par: Cheng, Keyuan, et autres
Publié: (2024)
Leveraging Logical Rules in Knowledge Editing: A Cherry on the Top
par: Cheng, Keyuan, et autres
Publié: (2024)
par: Cheng, Keyuan, et autres
Publié: (2024)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
MemEIC: A Step Toward Continual and Compositional Knowledge Editing
par: Seong, Jin, et autres
Publié: (2025)
par: Seong, Jin, et autres
Publié: (2025)
Locate-then-edit for Multi-hop Factual Recall under Knowledge Editing
par: Zhang, Zhuoran, et autres
Publié: (2024)
par: Zhang, Zhuoran, et autres
Publié: (2024)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
par: Veldanda, Akshaj Kumar, et autres
Publié: (2024)
par: Veldanda, Akshaj Kumar, et autres
Publié: (2024)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
par: He, Jiashu, et autres
Publié: (2025)
par: He, Jiashu, et autres
Publié: (2025)
Retrieval-enhanced Knowledge Editing in Language Models for Multi-Hop Question Answering
par: Shi, Yucheng, et autres
Publié: (2024)
par: Shi, Yucheng, et autres
Publié: (2024)
Documents similaires
-
Post-processing fairness with minimal changes
par: Di Gennaro, Federico, et autres
Publié: (2024) -
OptiGrad: A Fair and more Efficient Price Elasticity Optimization via a Gradient Based Learning
par: Grari, Vincent, et autres
Publié: (2024) -
ACT: Agentic Classification Tree
par: Grari, Vincent, et autres
Publié: (2025) -
Agentic Adversarial QA for Improving Domain-Specific LLMs
par: Grari, Vincent, et autres
Publié: (2026) -
Understanding Prediction Discrepancies in Machine Learning Classifiers
par: Renard, Xavier, et autres
Publié: (2021)