Mitigating Misalignment Contagion by Steering with Implicit Traits
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Maria, Luss, Ronny, Liu, Miao, Murugesan, Keerthiram, Ramamurthy, Karthikeyan, Bouneffouf, Djallel |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sparsity May Be All You Need: Sparse Random Parameter Adaptation
par: Rios, Jesus, et autres
Publié: (2025)
par: Rios, Jesus, et autres
Publié: (2025)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
par: Villa, Danielle, et autres
Publié: (2025)
par: Villa, Danielle, et autres
Publié: (2025)
Evaluating the Prompt Steerability of Large Language Models
par: Miehling, Erik, et autres
Publié: (2024)
par: Miehling, Erik, et autres
Publié: (2024)
Contextual Moral Value Alignment Through Context-Based Aggregation
par: Dognin, Pierre, et autres
Publié: (2024)
par: Dognin, Pierre, et autres
Publié: (2024)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025)
par: Ngong, Ivoline, et autres
Publié: (2025)
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
par: Basavatia, Shreyas, et autres
Publié: (2024)
par: Basavatia, Shreyas, et autres
Publié: (2024)
CELL your Model: Contrastive Explanations for Large Language Models
par: Luss, Ronny, et autres
Publié: (2024)
par: Luss, Ronny, et autres
Publié: (2024)
Scopes of Alignment
par: Varshney, Kush R., et autres
Publié: (2025)
par: Varshney, Kush R., et autres
Publié: (2025)
Multi-Level Explanations for Generative Language Models
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
Reasoning about concepts with LLMs: Inconsistencies abound
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
Assessing AI Utility: The Random Guesser Test for Sequential Decision-Making Systems
par: Ide, Shun, et autres
Publié: (2024)
par: Ide, Shun, et autres
Publié: (2024)
Survey: Multi-Armed Bandits Meet Large Language Models
par: Bouneffouf, Djallel, et autres
Publié: (2025)
par: Bouneffouf, Djallel, et autres
Publié: (2025)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
Towards Aligning Language Models with Textual Feedback
par: Lloret, Saüc Abadal, et autres
Publié: (2024)
par: Lloret, Saüc Abadal, et autres
Publié: (2024)
Targeted Advertising on Social Networks Using Online Variational Tensor Regression
par: Idé, Tsuyoshi, et autres
Publié: (2022)
par: Idé, Tsuyoshi, et autres
Publié: (2022)
COMPASS: Computational Mapping of Patient-Therapist Alliance Strategies with Language Modeling
par: Lin, Baihan, et autres
Publié: (2024)
par: Lin, Baihan, et autres
Publié: (2024)
The Ultimate Test of Superintelligent AI Agents: Can an AI Balance Care and Control in Asymmetric Relationships?
par: Bouneffouf, Djallel, et autres
Publié: (2025)
par: Bouneffouf, Djallel, et autres
Publié: (2025)
AI Steerability 360: A Toolkit for Steering Large Language Models
par: Miehling, Erik, et autres
Publié: (2026)
par: Miehling, Erik, et autres
Publié: (2026)
Exploring the Personality Traits of LLMs through Latent Features Steering
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
EXPLORER: Exploration-guided Reasoning for Textual Reinforcement Learning
par: Basu, Kinjal, et autres
Publié: (2024)
par: Basu, Kinjal, et autres
Publié: (2024)
Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
par: Achintalwar, Swapnaja, et autres
Publié: (2024)
par: Achintalwar, Swapnaja, et autres
Publié: (2024)
Conversational Topic Recommendation in Counseling and Psychotherapy with Decision Transformer and Large Language Models
par: Gunal, Aylin, et autres
Publié: (2024)
par: Gunal, Aylin, et autres
Publié: (2024)
Language Models Coupled with Metacognition Can Outperform Reasoning Models
par: Khandelwal, Vedant, et autres
Publié: (2025)
par: Khandelwal, Vedant, et autres
Publié: (2025)
RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation
par: Liang, Kaiqu, et autres
Publié: (2025)
par: Liang, Kaiqu, et autres
Publié: (2025)
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024)
par: Dhurandhar, Amit, et autres
Publié: (2024)
AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows
par: Ngong, Ivoline C., et autres
Publié: (2026)
par: Ngong, Ivoline C., et autres
Publié: (2026)
The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models
par: Riemer, Matthew, et autres
Publié: (2025)
par: Riemer, Matthew, et autres
Publié: (2025)
CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial Design
par: Neehal, Nafis, et autres
Publié: (2024)
par: Neehal, Nafis, et autres
Publié: (2024)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026)
par: Soligo, Anna, et autres
Publié: (2026)
Steering Towards Fairness: Mitigating Political Bias in LLMs
par: Nadeem, Afrozah, et autres
Publié: (2025)
par: Nadeem, Afrozah, et autres
Publié: (2025)
Leveraging Implicit Sentiments: Enhancing Reliability and Validity in Psychological Trait Evaluation of LLMs
par: Ma, Huanhuan, et autres
Publié: (2025)
par: Ma, Huanhuan, et autres
Publié: (2025)
Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
par: Hahm, Dongyoon, et autres
Publié: (2025)
par: Hahm, Dongyoon, et autres
Publié: (2025)
Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion
par: Wu, Yuanhong, et autres
Publié: (2026)
par: Wu, Yuanhong, et autres
Publié: (2026)
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
par: Yang, David H., et autres
Publié: (2026)
par: Yang, David H., et autres
Publié: (2026)
When Stability meets Sufficiency: Informative Explanations that do not Overwhelm
par: Luss, Ronny, et autres
Publié: (2021)
par: Luss, Ronny, et autres
Publié: (2021)
Fusion Steering: Prompt-Specific Activation Control
par: Chang, Waldemar, et autres
Publié: (2025)
par: Chang, Waldemar, et autres
Publié: (2025)
Understanding and Mitigating Dataset Corruption in LLM Steering
par: Anderson, Cullen, et autres
Publié: (2026)
par: Anderson, Cullen, et autres
Publié: (2026)
Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
par: Valentino, Marco, et autres
Publié: (2025)
par: Valentino, Marco, et autres
Publié: (2025)
An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage
par: Bu, Fan, et autres
Publié: (2025)
par: Bu, Fan, et autres
Publié: (2025)
Documents similaires
-
Sparsity May Be All You Need: Sparse Random Parameter Adaptation
par: Rios, Jesus, et autres
Publié: (2025) -
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
par: Villa, Danielle, et autres
Publié: (2025) -
Evaluating the Prompt Steerability of Large Language Models
par: Miehling, Erik, et autres
Publié: (2024) -
Contextual Moral Value Alignment Through Context-Based Aggregation
par: Dognin, Pierre, et autres
Publié: (2024) -
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025)