Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Herbster, Niklas, Zborowski, Martin, Tosato, Alberto, Gidel, Gauthier, Tosato, Tommaso |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History
par: Tosato, Tommaso, et autres
Publié: (2025)
par: Tosato, Tommaso, et autres
Publié: (2025)
Lost in Translation: The Algorithmic Gap Between LMs and the Brain
par: Tosato, Tommaso, et autres
Publié: (2024)
par: Tosato, Tommaso, et autres
Publié: (2024)
TUM-MiKaNi at SemEval-2025 Task 3: Towards Multilingual and Knowledge-Aware Non-factual Hallucination Identification
par: Anschütz, Miriam, et autres
Publié: (2025)
par: Anschütz, Miriam, et autres
Publié: (2025)
Subword Embedding from Bytes Gains Privacy without Sacrificing Accuracy and Complexity
par: Zhang, Mengjiao, et autres
Publié: (2024)
par: Zhang, Mengjiao, et autres
Publié: (2024)
CONHECIMENTO DO INDIVÍDUO OSTOMIZADO EM RELAÇÃO AO AUTOCUIDADO
par: Sonia Ramos Tosato
Publié: (2006)
par: Sonia Ramos Tosato
Publié: (2006)
Accelerating battery research with an AI interface between FINALES and Kadi4Mat
par: Tosato, Giovanna, et autres
Publié: (2026)
par: Tosato, Giovanna, et autres
Publié: (2026)
Activation Scaling for Steering and Interpreting Language Models
par: Stoehr, Niklas, et autres
Publié: (2024)
par: Stoehr, Niklas, et autres
Publié: (2024)
A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens
par: Dobre, David, et autres
Publié: (2025)
par: Dobre, David, et autres
Publié: (2025)
LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss
par: Rodriguez, Pau, et autres
Publié: (2025)
par: Rodriguez, Pau, et autres
Publié: (2025)
Self-Consuming Generative Models with Curated Data Provably Optimize Human Preferences
par: Ferbach, Damien, et autres
Publié: (2024)
par: Ferbach, Damien, et autres
Publié: (2024)
Tight Lower Bounds and Improved Convergence in Performative Prediction
par: Khorsandi, Pedram, et autres
Publié: (2024)
par: Khorsandi, Pedram, et autres
Publié: (2024)
GraphTranslator: Aligning Graph Model to Large Language Model for Open-ended Tasks
par: Zhang, Mengmei, et autres
Publié: (2024)
par: Zhang, Mengmei, et autres
Publié: (2024)
Learning Page Order in Shuffled WOO Releases
par: Kahraman, Efe, et autres
Publié: (2026)
par: Kahraman, Efe, et autres
Publié: (2026)
A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness
par: Schwinn, Leo, et autres
Publié: (2026)
par: Schwinn, Leo, et autres
Publié: (2026)
LLM-Safety Evaluations Lack Robustness
par: Beyer, Tim, et autres
Publié: (2025)
par: Beyer, Tim, et autres
Publié: (2025)
SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
par: Xia, Wei, et autres
Publié: (2025)
par: Xia, Wei, et autres
Publié: (2025)
FaithSteer-BENCH: A Deployment-Aligned Stress-Testing Benchmark for Inference-Time Steering
par: Ding, Zikang, et autres
Publié: (2026)
par: Ding, Zikang, et autres
Publié: (2026)
Steering Awareness: Detecting Activation Steering from Within
par: Rivera, Joshua Fonseca, et autres
Publié: (2025)
par: Rivera, Joshua Fonseca, et autres
Publié: (2025)
Dynamically Scaled Activation Steering
par: Ferrando, Alex, et autres
Publié: (2025)
par: Ferrando, Alex, et autres
Publié: (2025)
HyperSteer: Activation Steering at Scale with Hypernetworks
par: Sun, Jiuding, et autres
Publié: (2025)
par: Sun, Jiuding, et autres
Publié: (2025)
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?
par: Waghjale, Siddhant, et autres
Publié: (2024)
par: Waghjale, Siddhant, et autres
Publié: (2024)
Genre Controlled Music Generation via Activation Steering
par: Narashiman, Swathi, et autres
Publié: (2025)
par: Narashiman, Swathi, et autres
Publié: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
par: Heyman, Geert, et autres
Publié: (2026)
par: Heyman, Geert, et autres
Publié: (2026)
Minimizing Collateral Damage in Activation Steering
par: Nguyen, Tam, et autres
Publié: (2026)
par: Nguyen, Tam, et autres
Publié: (2026)
Steered LLM Activations are Non-Surjective
par: Mishra, Aayush, et autres
Publié: (2026)
par: Mishra, Aayush, et autres
Publié: (2026)
Activation Steering for Chain-of-Thought Compression
par: Azizi, Seyedarmin, et autres
Publié: (2025)
par: Azizi, Seyedarmin, et autres
Publié: (2025)
Endogenous Resistance to Activation Steering in Language Models
par: McKenzie, Alex, et autres
Publié: (2026)
par: McKenzie, Alex, et autres
Publié: (2026)
MidSteer: Optimal Affine Framework for Steering Generative Models
par: Gaintseva, Tatiana, et autres
Publié: (2026)
par: Gaintseva, Tatiana, et autres
Publié: (2026)
RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering
par: Ye, Wencheng, et autres
Publié: (2026)
par: Ye, Wencheng, et autres
Publié: (2026)
Activation Steering for Bias Mitigation: An Interpretable Approach to Safer LLMs
par: Dubey, Shivam
Publié: (2025)
par: Dubey, Shivam
Publié: (2025)
Fusion Steering: Prompt-Specific Activation Control
par: Chang, Waldemar, et autres
Publié: (2025)
par: Chang, Waldemar, et autres
Publié: (2025)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
par: Jiang, Xinyan, et autres
Publié: (2026)
par: Jiang, Xinyan, et autres
Publié: (2026)
TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering
par: Sui, Yuan, et autres
Publié: (2026)
par: Sui, Yuan, et autres
Publié: (2026)
YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation
par: Bounhar, Abdelaziz, et autres
Publié: (2026)
par: Bounhar, Abdelaziz, et autres
Publié: (2026)
Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions
par: Kang, Diancheng, et autres
Publié: (2026)
par: Kang, Diancheng, et autres
Publié: (2026)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
par: Xiong, Chen, et autres
Publié: (2026)
par: Xiong, Chen, et autres
Publié: (2026)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
SAKE: Steering Activations for Knowledge Editing
par: Scialanga, Marco, et autres
Publié: (2025)
par: Scialanga, Marco, et autres
Publié: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
CBMAS: Cognitive Behavioral Modeling via Activation Steering
par: Ismail, Ahmed H., et autres
Publié: (2026)
par: Ismail, Ahmed H., et autres
Publié: (2026)
Documents similaires
-
Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History
par: Tosato, Tommaso, et autres
Publié: (2025) -
Lost in Translation: The Algorithmic Gap Between LMs and the Brain
par: Tosato, Tommaso, et autres
Publié: (2024) -
TUM-MiKaNi at SemEval-2025 Task 3: Towards Multilingual and Knowledge-Aware Non-factual Hallucination Identification
par: Anschütz, Miriam, et autres
Publié: (2025) -
Subword Embedding from Bytes Gains Privacy without Sacrificing Accuracy and Complexity
par: Zhang, Mengjiao, et autres
Publié: (2024) -
CONHECIMENTO DO INDIVÍDUO OSTOMIZADO EM RELAÇÃO AO AUTOCUIDADO
par: Sonia Ramos Tosato
Publié: (2006)