Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berg, Cameron, Lulla, Roshni |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
par: Lulla, Roshni, et autres
Publié: (2026)
par: Lulla, Roshni, et autres
Publié: (2026)
Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings
par: Das, Nilanjana, et autres
Publié: (2026)
par: Das, Nilanjana, et autres
Publié: (2026)
To Tell The Truth: Language of Deception and Language Models
par: Hazra, Sanchaita, et autres
Publié: (2023)
par: Hazra, Sanchaita, et autres
Publié: (2023)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
par: Zhou, Hanhan, et autres
Publié: (2026)
par: Zhou, Hanhan, et autres
Publié: (2026)
Self-Steering Language Models
par: Grand, Gabriel, et autres
Publié: (2025)
par: Grand, Gabriel, et autres
Publié: (2025)
Causal Language Control in Multilingual Transformers via Sparse Feature Steering
par: Chou, Cheng-Ting, et autres
Publié: (2025)
par: Chou, Cheng-Ting, et autres
Publié: (2025)
An Assessment of Model-On-Model Deception
par: Heitkoetter, Julius, et autres
Publié: (2024)
par: Heitkoetter, Julius, et autres
Publié: (2024)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
par: Cheng, Zifeng, et autres
Publié: (2025)
par: Cheng, Zifeng, et autres
Publié: (2025)
Seamless Deception: Larger Language Models Are Better Knowledge Concealers
par: Ashok, Dhananjay, et autres
Publié: (2026)
par: Ashok, Dhananjay, et autres
Publié: (2026)
On the Limitations of Steering in Language Model Alignment
par: Niranjan, Chebrolu, et autres
Publié: (2025)
par: Niranjan, Chebrolu, et autres
Publié: (2025)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
par: Soo, Samuel, et autres
Publié: (2025)
par: Soo, Samuel, et autres
Publié: (2025)
The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning
par: Merrill, Scott, et autres
Publié: (2026)
par: Merrill, Scott, et autres
Publié: (2026)
Deceptive Automated Interpretability: Language Models Coordinating to Fool Oversight Systems
par: Lermen, Simon, et autres
Publié: (2025)
par: Lermen, Simon, et autres
Publié: (2025)
Unmasking the Shadows of AI: Investigating Deceptive Capabilities in Large Language Models
par: Guo, Linge
Publié: (2024)
par: Guo, Linge
Publié: (2024)
Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
par: Deng, Ruixuan, et autres
Publié: (2025)
par: Deng, Ruixuan, et autres
Publié: (2025)
Probing and Steering Evaluation Awareness of Language Models
par: Nguyen, Jord, et autres
Publié: (2025)
par: Nguyen, Jord, et autres
Publié: (2025)
Activation Scaling for Steering and Interpreting Language Models
par: Stoehr, Niklas, et autres
Publié: (2024)
par: Stoehr, Niklas, et autres
Publié: (2024)
Deception Abilities Emerged in Large Language Models
par: Hagendorff, Thilo
Publié: (2023)
par: Hagendorff, Thilo
Publié: (2023)
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
par: Vaugrante, Laurène, et autres
Publié: (2025)
par: Vaugrante, Laurène, et autres
Publié: (2025)
From Deception to Detection: The Dual Roles of Large Language Models in Fake News
par: Sallami, Dorsaf, et autres
Publié: (2024)
par: Sallami, Dorsaf, et autres
Publié: (2024)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
par: Wang, Xintong, et autres
Publié: (2024)
par: Wang, Xintong, et autres
Publié: (2024)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
Revealing Algorithmic Deductive Circuits for Logical Reasoning
par: Nguyen, Phuong Minh, et autres
Publié: (2026)
par: Nguyen, Phuong Minh, et autres
Publié: (2026)
That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation
par: Bae, Jaesung, et autres
Publié: (2025)
par: Bae, Jaesung, et autres
Publié: (2025)
Cross-Lingual Activation Steering for Multilingual Language Models
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
par: Pokharel, Rhitabrat, et autres
Publié: (2026)
Disentangling Exploration of Large Language Models by Optimal Exploitation
par: Grams, Tim, et autres
Publié: (2025)
par: Grams, Tim, et autres
Publié: (2025)
Steering Large Language Models to Evaluate and Amplify Creativity
par: Olson, Matthew Lyle, et autres
Publié: (2024)
par: Olson, Matthew Lyle, et autres
Publié: (2024)
Prompt-Based Value Steering of Large Language Models
par: Abbo, Giulio Antonio, et autres
Publié: (2025)
par: Abbo, Giulio Antonio, et autres
Publié: (2025)
LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
par: Olson, Matthew Lyle, et autres
Publié: (2026)
par: Olson, Matthew Lyle, et autres
Publié: (2026)
Too Big to Fool: Resisting Deception in Language Models
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
par: Samsami, Mohammad Reza, et autres
Publié: (2024)
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
par: Dumas, Clément, et autres
Publié: (2024)
par: Dumas, Clément, et autres
Publié: (2024)
Detecting Deceptive Dark Patterns in E-commerce Platforms
par: Ramteke, Arya, et autres
Publié: (2024)
par: Ramteke, Arya, et autres
Publié: (2024)
Steering Language Models Before They Speak: Logit-Level Interventions
par: An, Hyeseon, et autres
Publié: (2026)
par: An, Hyeseon, et autres
Publié: (2026)
DLM-SWAI: Steering Diffusion Language Models Before They Unmask
par: An, Hyeseon, et autres
Publié: (2026)
par: An, Hyeseon, et autres
Publié: (2026)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
par: Hua, Tim Tian, et autres
Publié: (2025)
par: Hua, Tim Tian, et autres
Publié: (2025)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
par: Siu, Vincent, et autres
Publié: (2025)
par: Siu, Vincent, et autres
Publié: (2025)
Tradeoffs Between Alignment and Helpfulness in Language Models with Steering Methods
par: Wolf, Yotam, et autres
Publié: (2024)
par: Wolf, Yotam, et autres
Publié: (2024)
On Effects of Steering Latent Representation for Large Language Model Unlearning
par: Huu-Tien, Dang, et autres
Publié: (2024)
par: Huu-Tien, Dang, et autres
Publié: (2024)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
par: Chen, Zixin, et autres
Publié: (2025)
par: Chen, Zixin, et autres
Publié: (2025)
Exploring the Personality Traits of LLMs through Latent Features Steering
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
Documents similaires
-
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
par: Lulla, Roshni, et autres
Publié: (2026) -
Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings
par: Das, Nilanjana, et autres
Publié: (2026) -
To Tell The Truth: Language of Deception and Language Models
par: Hazra, Sanchaita, et autres
Publié: (2023) -
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
par: Zhou, Hanhan, et autres
Publié: (2026) -
Self-Steering Language Models
par: Grand, Gabriel, et autres
Publié: (2025)