Controlling Large Language Models Through Concept Activation Vectors
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Hanyu, Wang, Xiting, Li, Chengao, Ao, Xiang, He, Qing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
by: Li, Chengao, et al.
Published: (2025)
by: Li, Chengao, et al.
Published: (2025)
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
by: Xu, Zhihao, et al.
Published: (2024)
by: Xu, Zhihao, et al.
Published: (2024)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
by: Jin, Haoran, et al.
Published: (2025)
by: Jin, Haoran, et al.
Published: (2025)
Enhancing Safety of Large Language Models via Embedding Space Separation
by: Zhao, Xu, et al.
Published: (2026)
by: Zhao, Xu, et al.
Published: (2026)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
by: Weng, Jiaqi, et al.
Published: (2025)
by: Weng, Jiaqi, et al.
Published: (2025)
How Large Language Models Need Symbolism
by: Deng, Xiaotie, et al.
Published: (2025)
by: Deng, Xiaotie, et al.
Published: (2025)
Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator
by: Cao, Qian, et al.
Published: (2025)
by: Cao, Qian, et al.
Published: (2025)
Analogical Reasoning Inside Large Language Models: Concept Vectors and the Limits of Abstraction
by: Opiełka, Gustaw, et al.
Published: (2025)
by: Opiełka, Gustaw, et al.
Published: (2025)
Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models
by: Li, Jiaqian, et al.
Published: (2026)
by: Li, Jiaqian, et al.
Published: (2026)
Schrodinger's Memory: Large Language Models
by: Wang, Wei, et al.
Published: (2024)
by: Wang, Wei, et al.
Published: (2024)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
by: Siu, Vincent, et al.
Published: (2025)
by: Siu, Vincent, et al.
Published: (2025)
Activation-Space Anchored Access Control for Multi-Class Permission Reasoning in Large Language Models
by: Zhang, Zhaopeng, et al.
Published: (2026)
by: Zhang, Zhaopeng, et al.
Published: (2026)
Controlling Large Language Model Agents with Entropic Activation Steering
by: Rahn, Nate, et al.
Published: (2024)
by: Rahn, Nate, et al.
Published: (2024)
Latent Structure Modulation in Large Language Models Through Stochastic Concept Embedding Transitions
by: Whitaker, Stefan, et al.
Published: (2025)
by: Whitaker, Stefan, et al.
Published: (2025)
Knowledge Vector of Logical Reasoning in Large Language Models
by: Wang, Zixuan, et al.
Published: (2026)
by: Wang, Zixuan, et al.
Published: (2026)
Unsupervised Concept Vector Extraction for Bias Control in LLMs
by: Cyberey, Hannah, et al.
Published: (2025)
by: Cyberey, Hannah, et al.
Published: (2025)
EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding
by: Li, Ao, et al.
Published: (2024)
by: Li, Ao, et al.
Published: (2024)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
by: Zhou, Jie, et al.
Published: (2025)
by: Zhou, Jie, et al.
Published: (2025)
Locating and Extracting Relational Concepts in Large Language Models
by: Wang, Zijian, et al.
Published: (2024)
by: Wang, Zijian, et al.
Published: (2024)
Function Vectors in Large Language Models
by: Todd, Eric, et al.
Published: (2023)
by: Todd, Eric, et al.
Published: (2023)
Measuring Maximum Activations in Open Large Language Models
by: Chen, Luxuan, et al.
Published: (2026)
by: Chen, Luxuan, et al.
Published: (2026)
SLANG: New Concept Comprehension of Large Language Models
by: Mei, Lingrui, et al.
Published: (2024)
by: Mei, Lingrui, et al.
Published: (2024)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
by: Joshi, Shruti, et al.
Published: (2025)
by: Joshi, Shruti, et al.
Published: (2025)
AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models
by: Li, Zeyu, et al.
Published: (2025)
by: Li, Zeyu, et al.
Published: (2025)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
by: Cao, Yuanpu, et al.
Published: (2024)
by: Cao, Yuanpu, et al.
Published: (2024)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
by: Zhao, Haiyan, et al.
Published: (2025)
by: Zhao, Haiyan, et al.
Published: (2025)
From Word Vectors to Multimodal Embeddings: Techniques, Applications, and Future Directions For Large Language Models
by: Zhang, Charles, et al.
Published: (2024)
by: Zhang, Charles, et al.
Published: (2024)
ConceptViz: A Visual Analytics Approach for Exploring Concepts in Large Language Models
by: Li, Haoxuan, et al.
Published: (2025)
by: Li, Haoxuan, et al.
Published: (2025)
ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
by: He, Qianyu, et al.
Published: (2025)
by: He, Qianyu, et al.
Published: (2025)
Patches of Nonlinearity: Instruction Vectors in Large Language Models
by: Bigoulaeva, Irina, et al.
Published: (2026)
by: Bigoulaeva, Irina, et al.
Published: (2026)
Style Vectors for Steering Generative Large Language Model
by: Konen, Kai, et al.
Published: (2024)
by: Konen, Kai, et al.
Published: (2024)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
Activation-Guided Consensus Merging for Large Language Models
by: Yao, Yuxuan, et al.
Published: (2025)
by: Yao, Yuxuan, et al.
Published: (2025)
Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models
by: Roh, Youngji, et al.
Published: (2026)
by: Roh, Youngji, et al.
Published: (2026)
Open-domain Implicit Format Control for Large Language Model Generation
by: Yao, Yiqun, et al.
Published: (2024)
by: Yao, Yiqun, et al.
Published: (2024)
Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time
by: Kang, Xinyue, et al.
Published: (2025)
by: Kang, Xinyue, et al.
Published: (2025)
EFSA: Towards Event-Level Financial Sentiment Analysis
by: Chen, Tianyu, et al.
Published: (2024)
by: Chen, Tianyu, et al.
Published: (2024)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
by: Ma, Chi, et al.
Published: (2024)
by: Ma, Chi, et al.
Published: (2024)
Similar Items
-
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
by: Li, Chengao, et al.
Published: (2025) -
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
by: Xu, Zhihao, et al.
Published: (2024) -
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
by: Jin, Haoran, et al.
Published: (2025) -
Enhancing Safety of Large Language Models via Embedding Space Separation
by: Zhao, Xu, et al.
Published: (2026) -
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
by: Weng, Jiaqi, et al.
Published: (2025)