Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Cao, Yuanpu, Zhang, Tianrong, Cao, Bochuan, Yin, Ziyi, Lin, Lu, Ma, Fenglong, Chen, Jinghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
por: Cao, Yuanpu, et al.
Publicado: (2023)
por: Cao, Yuanpu, et al.
Publicado: (2023)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
por: Cao, Bochuan, et al.
Publicado: (2023)
por: Cao, Bochuan, et al.
Publicado: (2023)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
por: Wang, Hanyu, et al.
Publicado: (2025)
por: Wang, Hanyu, et al.
Publicado: (2025)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
por: Cao, Bochuan, et al.
Publicado: (2025)
por: Cao, Bochuan, et al.
Publicado: (2025)
WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response
por: Zhang, Tianrong, et al.
Publicado: (2024)
por: Zhang, Tianrong, et al.
Publicado: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
por: Xiang, Hao, et al.
Publicado: (2024)
por: Xiang, Hao, et al.
Publicado: (2024)
JoPA:Explaining Large Language Model's Generation via Joint Prompt Attribution
por: Chang, Yurui, et al.
Publicado: (2024)
por: Chang, Yurui, et al.
Publicado: (2024)
Adversarially Robust Industrial Anomaly Detection Through Diffusion Model
por: Cao, Yuanpu, et al.
Publicado: (2024)
por: Cao, Yuanpu, et al.
Publicado: (2024)
Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time
por: Lan, Yifan, et al.
Publicado: (2025)
por: Lan, Yifan, et al.
Publicado: (2025)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Style Vectors for Steering Generative Large Language Model
por: Konen, Kai, et al.
Publicado: (2024)
por: Konen, Kai, et al.
Publicado: (2024)
AdvI2I: Adversarial Image Attack on Image-to-Image Diffusion models
por: Zeng, Yaopei, et al.
Publicado: (2024)
por: Zeng, Yaopei, et al.
Publicado: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
por: Yin, Ziyi, et al.
Publicado: (2025)
por: Yin, Ziyi, et al.
Publicado: (2025)
PreFlect: From Retrospective to Prospective Reflection in Large Language Model Agents
por: Wang, Hanyu, et al.
Publicado: (2026)
por: Wang, Hanyu, et al.
Publicado: (2026)
Corpus-Steered Query Expansion with Large Language Models
por: Lei, Yibin, et al.
Publicado: (2024)
por: Lei, Yibin, et al.
Publicado: (2024)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
por: Cheng, Zifeng, et al.
Publicado: (2025)
por: Cheng, Zifeng, et al.
Publicado: (2025)
Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time
por: Kang, Xinyue, et al.
Publicado: (2025)
por: Kang, Xinyue, et al.
Publicado: (2025)
ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models
por: Wang, Yujia, et al.
Publicado: (2025)
por: Wang, Yujia, et al.
Publicado: (2025)
Steering Large Language Models for Machine Translation Personalization
por: Scalena, Daniel, et al.
Publicado: (2025)
por: Scalena, Daniel, et al.
Publicado: (2025)
The Cylindrical Representation Hypothesis for Language Model Steering
por: Gao, Lang, et al.
Publicado: (2026)
por: Gao, Lang, et al.
Publicado: (2026)
Compositional Steering of Large Language Models with Steering Tokens
por: Radevski, Gorjan, et al.
Publicado: (2026)
por: Radevski, Gorjan, et al.
Publicado: (2026)
The Impact of Steering Large Language Models with Persona Vectors in Educational Applications
por: Wu, Yongchao, et al.
Publicado: (2026)
por: Wu, Yongchao, et al.
Publicado: (2026)
SteerX: Disentangled Steering for LLM Personalization
por: Zhao, Xiaoyan, et al.
Publicado: (2025)
por: Zhao, Xiaoyan, et al.
Publicado: (2025)
Beyond Static Personas: Situational Personality Steering for Large Language Models
por: Wei, Zesheng, et al.
Publicado: (2026)
por: Wei, Zesheng, et al.
Publicado: (2026)
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
por: Pai, Tsung-Min, et al.
Publicado: (2025)
por: Pai, Tsung-Min, et al.
Publicado: (2025)
Automating Steering for Safe Multimodal Large Language Models
por: Wu, Lyucheng, et al.
Publicado: (2025)
por: Wu, Lyucheng, et al.
Publicado: (2025)
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026)
por: Zhang, Xuechen, et al.
Publicado: (2026)
Psychological Steering of Large Language Models
por: Blas, Leonardo, et al.
Publicado: (2026)
por: Blas, Leonardo, et al.
Publicado: (2026)
Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generation
por: Chang, Yurui, et al.
Publicado: (2025)
por: Chang, Yurui, et al.
Publicado: (2025)
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
por: Zhu, Jian-Qiao, et al.
Publicado: (2025)
por: Zhu, Jian-Qiao, et al.
Publicado: (2025)
Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models
por: Li, Jiaqian, et al.
Publicado: (2026)
por: Li, Jiaqian, et al.
Publicado: (2026)
RepIt: Steering Language Models with Concept-Specific Refusal Vectors
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation
por: Diallo, Diaoulé, et al.
Publicado: (2026)
por: Diallo, Diaoulé, et al.
Publicado: (2026)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
por: Yang, Jingyuan, et al.
Publicado: (2025)
por: Yang, Jingyuan, et al.
Publicado: (2025)
Steering off Course: Reliability Challenges in Steering Language Models
por: Da Silva, Patrick Queiroz, et al.
Publicado: (2025)
por: Da Silva, Patrick Queiroz, et al.
Publicado: (2025)
Letting Tutor Personas "Speak Up" for LLMs: Learning Steering Vectors from Dialogue via Preference Optimization
por: Lee, Jaewook, et al.
Publicado: (2026)
por: Lee, Jaewook, et al.
Publicado: (2026)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
por: Zhao, Haiyan, et al.
Publicado: (2025)
por: Zhao, Haiyan, et al.
Publicado: (2025)
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
por: Jin, Zehao, et al.
Publicado: (2026)
por: Jin, Zehao, et al.
Publicado: (2026)
CoSteer: Collaborative Decoding-Time Personalization via Local Delta Steering
por: Lv, Hang, et al.
Publicado: (2025)
por: Lv, Hang, et al.
Publicado: (2025)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
por: Wang, Xintong, et al.
Publicado: (2024)
por: Wang, Xintong, et al.
Publicado: (2024)
Ejemplares similares
-
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
por: Cao, Yuanpu, et al.
Publicado: (2023) -
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
por: Cao, Bochuan, et al.
Publicado: (2023) -
TruthFlow: Truthful LLM Generation via Representation Flow Correction
por: Wang, Hanyu, et al.
Publicado: (2025) -
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
por: Cao, Bochuan, et al.
Publicado: (2025) -
WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response
por: Zhang, Tianrong, et al.
Publicado: (2024)