Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Deshpande, Vijeta, Giyahchi, Tootiya, Padmanabhan, Veena, Akoglu, Leman, Rumshisky, Anna |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
by: Chen, Wenbo, et al.
Published: (2026)
by: Chen, Wenbo, et al.
Published: (2026)
Emergent Abilities in Reduced-Scale Generative Language Models
by: Muckatira, Sherin, et al.
Published: (2024)
by: Muckatira, Sherin, et al.
Published: (2024)
Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training
by: Shivagunde, Namrata, et al.
Published: (2026)
by: Shivagunde, Namrata, et al.
Published: (2026)
Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models
by: Deshpande, Vijeta, et al.
Published: (2025)
by: Deshpande, Vijeta, et al.
Published: (2025)
A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization
by: Muckatira, Sherin, et al.
Published: (2026)
by: Muckatira, Sherin, et al.
Published: (2026)
A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations
by: Deshpande, Vijeta, et al.
Published: (2025)
by: Deshpande, Vijeta, et al.
Published: (2025)
Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning
by: Lialin, Vladislav, et al.
Published: (2023)
by: Lialin, Vladislav, et al.
Published: (2023)
Outlier Detection Bias Busted: Understanding Sources of Algorithmic Bias through Data-centric Factors
by: Ding, Xueying, et al.
Published: (2024)
by: Ding, Xueying, et al.
Published: (2024)
Self-Tuning Self-Supervised Image Anomaly Detection
by: Yoo, Jaemin, et al.
Published: (2023)
by: Yoo, Jaemin, et al.
Published: (2023)
LocalTweets to LocalHealth: A Mental Health Surveillance Framework Based on Twitter Data
by: Deshpande, Vijeta, et al.
Published: (2024)
by: Deshpande, Vijeta, et al.
Published: (2024)
Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
by: Ding, Xueying, et al.
Published: (2025)
by: Ding, Xueying, et al.
Published: (2025)
Structured Prompt Optimization Meets Reinforcement Learning for Global and Local Interpretability over Complex Text
by: Zhou, Tianyang, et al.
Published: (2026)
by: Zhou, Tianyang, et al.
Published: (2026)
Toward Privileged Foundation Models:LUPI for Accelerated and Improved Learning
by: Ding, Xueying, et al.
Published: (2026)
by: Ding, Xueying, et al.
Published: (2026)
Pard: Permutation-Invariant Autoregressive Diffusion for Graph Generation
by: Zhao, Lingxiao, et al.
Published: (2024)
by: Zhao, Lingxiao, et al.
Published: (2024)
Adapting Decoder-Based Language Models for Diverse Encoder Downstream Tasks
by: Suganthan, Paul, et al.
Published: (2025)
by: Suganthan, Paul, et al.
Published: (2025)
Steering Language Models With Activation Engineering
by: Turner, Alexander Matt, et al.
Published: (2023)
by: Turner, Alexander Matt, et al.
Published: (2023)
Synthetic vs. Gold: The Role of LLM Generated Labels and Data in Cyberbullying Detection
by: Kazemi, Arefeh, et al.
Published: (2025)
by: Kazemi, Arefeh, et al.
Published: (2025)
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
by: Jin, Zehao, et al.
Published: (2026)
by: Jin, Zehao, et al.
Published: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
by: Sun, Jiuding, et al.
Published: (2025)
by: Sun, Jiuding, et al.
Published: (2025)
FoMo-0D: A Foundation Model for Zero-shot Tabular Outlier Detection
by: Shen, Yuchen, et al.
Published: (2024)
by: Shen, Yuchen, et al.
Published: (2024)
Playing with Words, Improving with Rewards: Training Language Models for Creative Association
by: Deshpande, Vijeta, et al.
Published: (2026)
by: Deshpande, Vijeta, et al.
Published: (2026)
Activation Steering via Generative Causal Mediation
by: Sankaranarayanan, Aruna, et al.
Published: (2026)
by: Sankaranarayanan, Aruna, et al.
Published: (2026)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
by: Siu, Vincent, et al.
Published: (2025)
by: Siu, Vincent, et al.
Published: (2025)
Steer Like the LLM: Activation Steering that Mimics Prompting
by: Heyman, Geert, et al.
Published: (2026)
by: Heyman, Geert, et al.
Published: (2026)
ROAST: Rollout-based On-distribution Activation Steering Technique
by: Su, Xuanbo, et al.
Published: (2026)
by: Su, Xuanbo, et al.
Published: (2026)
Unified Discrete Diffusion for Categorical Data
by: Zhao, Lingxiao, et al.
Published: (2024)
by: Zhao, Lingxiao, et al.
Published: (2024)
CoBAD: Modeling Collective Behaviors for Human Mobility Anomaly Detection
by: Wen, Haomin, et al.
Published: (2025)
by: Wen, Haomin, et al.
Published: (2025)
The Power of LLM-Generated Synthetic Data for Stance Detection in Online Political Discussions
by: Wagner, Stefan Sylvius, et al.
Published: (2024)
by: Wagner, Stefan Sylvius, et al.
Published: (2024)
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
by: You, Zejia, et al.
Published: (2026)
by: You, Zejia, et al.
Published: (2026)
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
by: Hegazy, Amr, et al.
Published: (2025)
by: Hegazy, Amr, et al.
Published: (2025)
Steering MoE LLMs via Expert (De)Activation
by: Fayyaz, Mohsen, et al.
Published: (2025)
by: Fayyaz, Mohsen, et al.
Published: (2025)
VIP-COP: Context Optimization for Tabular Foundation Models
by: Chen, Yilong, et al.
Published: (2026)
by: Chen, Yilong, et al.
Published: (2026)
Prompt Perturbation Consistency Learning for Robust Language Models
by: Qiang, Yao, et al.
Published: (2024)
by: Qiang, Yao, et al.
Published: (2024)
From Zero to Hero: Advancing Zero-Shot Foundation Models for Tabular Outlier Detection
by: Ding, Xueying, et al.
Published: (2026)
by: Ding, Xueying, et al.
Published: (2026)
Programming Refusal with Conditional Activation Steering
by: Lee, Bruce W., et al.
Published: (2024)
by: Lee, Bruce W., et al.
Published: (2024)
SAKE: Steering Activations for Knowledge Editing
by: Scialanga, Marco, et al.
Published: (2025)
by: Scialanga, Marco, et al.
Published: (2025)
Understanding How CodeLLMs (Mis)Predict Types with Activation Steering
by: Lucchetti, Francesca, et al.
Published: (2024)
by: Lucchetti, Francesca, et al.
Published: (2024)
Exploring the Impact of a Transformer's Latent Space Geometry on Downstream Task Performance
by: Marbut, Anna C., et al.
Published: (2024)
by: Marbut, Anna C., et al.
Published: (2024)
Out-of-Distribution Detection using Synthetic Data Generation
by: Abbas, Momin, et al.
Published: (2025)
by: Abbas, Momin, et al.
Published: (2025)
FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers
by: Wang, Sihan, et al.
Published: (2026)
by: Wang, Sihan, et al.
Published: (2026)
Similar Items
-
Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
by: Chen, Wenbo, et al.
Published: (2026) -
Emergent Abilities in Reduced-Scale Generative Language Models
by: Muckatira, Sherin, et al.
Published: (2024) -
Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training
by: Shivagunde, Namrata, et al.
Published: (2026) -
Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models
by: Deshpande, Vijeta, et al.
Published: (2025) -
A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization
by: Muckatira, Sherin, et al.
Published: (2026)