Mitigating Memorization in LLMs using Activation Steering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Suri, Manan, Anand, Nishit, Bhaskar, Amisha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs
par: Hans, Abhimanyu, et autres
Publié: (2024)
par: Hans, Abhimanyu, et autres
Publié: (2024)
Learning Illumination Control in Diffusion Models
par: Anand, Nishit, et autres
Publié: (2026)
par: Anand, Nishit, et autres
Publié: (2026)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
par: Li, Yichen, et autres
Publié: (2025)
par: Li, Yichen, et autres
Publié: (2025)
Generalization or Memorization: Dynamic Decoding for Mode Steering
par: Zhang, Xuanming
Publié: (2025)
par: Zhang, Xuanming
Publié: (2025)
The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation
par: Xiong, Alexander, et autres
Publié: (2025)
par: Xiong, Alexander, et autres
Publié: (2025)
Continual Memorization of Factoids in Language Models
par: Chen, Howard, et autres
Publié: (2024)
par: Chen, Howard, et autres
Publié: (2024)
Mitigating Unintended Memorization with LoRA in Federated Learning for LLMs
par: Bossy, Thierry, et autres
Publié: (2025)
par: Bossy, Thierry, et autres
Publié: (2025)
Steering Towards Fairness: Mitigating Political Bias in LLMs
par: Nadeem, Afrozah, et autres
Publié: (2025)
par: Nadeem, Afrozah, et autres
Publié: (2025)
Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors
par: Wang, Weixuan, et autres
Publié: (2024)
par: Wang, Weixuan, et autres
Publié: (2024)
Understanding How CodeLLMs (Mis)Predict Types with Activation Steering
par: Lucchetti, Francesca, et autres
Publié: (2024)
par: Lucchetti, Francesca, et autres
Publié: (2024)
Randomized Masked Finetuning: An Efficient Way to Mitigate Memorization of PIIs in LLMs
par: Joshi, Kunj, et autres
Publié: (2025)
par: Joshi, Kunj, et autres
Publié: (2025)
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
par: Hegazy, Amr, et autres
Publié: (2025)
par: Hegazy, Amr, et autres
Publié: (2025)
Steering MoE LLMs via Expert (De)Activation
par: Fayyaz, Mohsen, et autres
Publié: (2025)
par: Fayyaz, Mohsen, et autres
Publié: (2025)
Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs
par: Yan, Lecheng, et autres
Publié: (2026)
par: Yan, Lecheng, et autres
Publié: (2026)
Mitigating Memorization In Language Models
par: Sakarvadia, Mansi, et autres
Publié: (2024)
par: Sakarvadia, Mansi, et autres
Publié: (2024)
The Unreasonable Ineffectiveness of Nucleus Sampling on Mitigating Text Memorization
par: Borec, Luka, et autres
Publié: (2024)
par: Borec, Luka, et autres
Publié: (2024)
Extracting Unlearned Information from LLMs with Activation Steering
par: Seyitoğlu, Atakan, et autres
Publié: (2024)
par: Seyitoğlu, Atakan, et autres
Publié: (2024)
SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering
par: Maskey, Utsav, et autres
Publié: (2025)
par: Maskey, Utsav, et autres
Publié: (2025)
Alpaca against Vicuna: Using LLMs to Uncover Memorization of LLMs
par: Kassem, Aly M., et autres
Publié: (2024)
par: Kassem, Aly M., et autres
Publié: (2024)
Latent Phase-Shift Rollback: Inference-Time Error Correction via Residual Stream Monitoring and KV-Cache Steering
par: Gupta, Manan, et autres
Publié: (2026)
par: Gupta, Manan, et autres
Publié: (2026)
Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs
par: Bhandari, Pranav, et autres
Publié: (2025)
par: Bhandari, Pranav, et autres
Publié: (2025)
Fine-Grained Activation Steering: Steering Less, Achieving More
par: Feng, Zijian, et autres
Publié: (2026)
par: Feng, Zijian, et autres
Publié: (2026)
Memorization or Reasoning? Exploring the Idiom Understanding of LLMs
par: Kim, Jisu, et autres
Publié: (2025)
par: Kim, Jisu, et autres
Publié: (2025)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
par: Anand, Nikhil, et autres
Publié: (2026)
par: Anand, Nikhil, et autres
Publié: (2026)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
par: Siddique, Zara, et autres
Publié: (2025)
par: Siddique, Zara, et autres
Publié: (2025)
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
par: Valentino, Marco, et autres
Publié: (2025)
par: Valentino, Marco, et autres
Publié: (2025)
Skeleton-based Coherence Modeling in Narratives
par: Asnani, Nishit, et autres
Publié: (2026)
par: Asnani, Nishit, et autres
Publié: (2026)
Steer2Edit: From Activation Steering to Component-Level Editing
par: Sun, Chung-En, et autres
Publié: (2026)
par: Sun, Chung-En, et autres
Publié: (2026)
Memorization and Knowledge Injection in Gated LLMs
par: Pan, Xu, et autres
Publié: (2025)
par: Pan, Xu, et autres
Publié: (2025)
Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Understanding Verbatim Memorization in LLMs Through Circuit Discovery
par: Lasy, Ilya, et autres
Publié: (2025)
par: Lasy, Ilya, et autres
Publié: (2025)
Steering Awareness: Detecting Activation Steering from Within
par: Rivera, Joshua Fonseca, et autres
Publié: (2025)
par: Rivera, Joshua Fonseca, et autres
Publié: (2025)
ChartLens: Fine-grained Visual Attribution in Charts
par: Suri, Manan, et autres
Publié: (2025)
par: Suri, Manan, et autres
Publié: (2025)
VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation
par: Suri, Manan, et autres
Publié: (2024)
par: Suri, Manan, et autres
Publié: (2024)
CodeScout: Contextual Problem Statement Enhancement for Software Agents
par: Suri, Manan, et autres
Publié: (2026)
par: Suri, Manan, et autres
Publié: (2026)
Beyond Memorization: Distinguishing between Reductive and Epistemic Reasoning in LLMs using Classic Logic Puzzles
par: Gabay, Adi, et autres
Publié: (2026)
par: Gabay, Adi, et autres
Publié: (2026)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
par: Anand, Nishit, et autres
Publié: (2024)
par: Anand, Nishit, et autres
Publié: (2024)
From Amateur to Master: Infusing Knowledge into LLMs via Automated Curriculum Learning
par: Neema, Nishit, et autres
Publié: (2025)
par: Neema, Nishit, et autres
Publié: (2025)
SteerConf: Steering LLMs for Confidence Elicitation
par: Zhou, Ziang, et autres
Publié: (2025)
par: Zhou, Ziang, et autres
Publié: (2025)
FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records
par: Frew, Michael, et autres
Publié: (2026)
par: Frew, Michael, et autres
Publié: (2026)
Documents similaires
-
Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs
par: Hans, Abhimanyu, et autres
Publié: (2024) -
Learning Illumination Control in Diffusion Models
par: Anand, Nishit, et autres
Publié: (2026) -
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
par: Li, Yichen, et autres
Publié: (2025) -
Generalization or Memorization: Dynamic Decoding for Mode Steering
par: Zhang, Xuanming
Publié: (2025) -
The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation
par: Xiong, Alexander, et autres
Publié: (2025)