Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Xinyan, Zhang, Lin, Zhang, Jiayi, Yang, Qingsong, Hu, Guimin, Wang, Di, Hu, Lijie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026)
por: Jiang, Xinyan, et al.
Publicado: (2026)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
por: You, Liangliang, et al.
Publicado: (2025)
por: You, Liangliang, et al.
Publicado: (2025)
PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration
por: Yu, Manjiang, et al.
Publicado: (2025)
por: Yu, Manjiang, et al.
Publicado: (2025)
Beyond Scalars: Evaluating and Understanding LLM Reasoning via Geometric Progress and Stability
por: Jiang, Xinyan, et al.
Publicado: (2026)
por: Jiang, Xinyan, et al.
Publicado: (2026)
Functional Subspace Watermarking for Large Language Models
por: Ding, Zikang, et al.
Publicado: (2026)
por: Ding, Zikang, et al.
Publicado: (2026)
Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
Controlling Repetition in Protein Language Models
por: Zhang, Jiahao, et al.
Publicado: (2026)
por: Zhang, Jiahao, et al.
Publicado: (2026)
Understanding In-context Learning of Addition via Activation Subspaces
por: Hu, Xinyan, et al.
Publicado: (2025)
por: Hu, Xinyan, et al.
Publicado: (2025)
The Compositional Architecture of Regret in Large Language Models
por: Cui, Xiangxiang, et al.
Publicado: (2025)
por: Cui, Xiangxiang, et al.
Publicado: (2025)
Partitioner Guided Modal Learning Framework
por: Hu, Guimin, et al.
Publicado: (2025)
por: Hu, Guimin, et al.
Publicado: (2025)
FaithSteer-BENCH: A Deployment-Aligned Stress-Testing Benchmark for Inference-Time Steering
por: Ding, Zikang, et al.
Publicado: (2026)
por: Ding, Zikang, et al.
Publicado: (2026)
Compositional Subspace Representation Fine-tuning for Adaptive Large Language Models
por: Zhou, Andy
Publicado: (2025)
por: Zhou, Andy
Publicado: (2025)
Exploring the Personality Traits of LLMs through Latent Features Steering
por: Yang, Shu, et al.
Publicado: (2024)
por: Yang, Shu, et al.
Publicado: (2024)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
por: Yang, Qishun, et al.
Publicado: (2026)
por: Yang, Qishun, et al.
Publicado: (2026)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
por: Yu, Xiaomin, et al.
Publicado: (2026)
por: Yu, Xiaomin, et al.
Publicado: (2026)
Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering
por: Li, Xiaomin, et al.
Publicado: (2026)
por: Li, Xiaomin, et al.
Publicado: (2026)
Towards Multi-dimensional Explanation Alignment for Medical Classification
por: Hu, Lijie, et al.
Publicado: (2024)
por: Hu, Lijie, et al.
Publicado: (2024)
Predicting LLM Output Length via Entropy-Guided Representations
por: Xie, Huanyi, et al.
Publicado: (2026)
por: Xie, Huanyi, et al.
Publicado: (2026)
SMoA: Improving Multi-agent Large Language Models with Sparse Mixture-of-Agents
por: Li, Dawei, et al.
Publicado: (2024)
por: Li, Dawei, et al.
Publicado: (2024)
Efficient Text-Attributed Graph Learning through Selective Annotation and Graph Alignment
por: Xie, Huanyi, et al.
Publicado: (2025)
por: Xie, Huanyi, et al.
Publicado: (2025)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
por: Chuang, Yung-Sung, et al.
Publicado: (2025)
por: Chuang, Yung-Sung, et al.
Publicado: (2025)
UGID: Unified Graph Isomorphism for Debiasing Large Language Models
por: Ding, Zikang, et al.
Publicado: (2026)
por: Ding, Zikang, et al.
Publicado: (2026)
Private Language Models via Truncated Laplacian Mechanism
por: Huang, Tianhao, et al.
Publicado: (2024)
por: Huang, Tianhao, et al.
Publicado: (2024)
Improving Attributed Text Generation of Large Language Models via Preference Learning
por: Li, Dongfang, et al.
Publicado: (2024)
por: Li, Dongfang, et al.
Publicado: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
por: Nguyen, Duy, et al.
Publicado: (2025)
por: Nguyen, Duy, et al.
Publicado: (2025)
An Uncertainty-Driven Adaptive Self-Alignment Framework for Large Language Models
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias
por: Xu, Yuemei, et al.
Publicado: (2024)
por: Xu, Yuemei, et al.
Publicado: (2024)
LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion
por: Zhou, Guanghao, et al.
Publicado: (2026)
por: Zhou, Guanghao, et al.
Publicado: (2026)
On the Limitations of Steering in Language Model Alignment
por: Niranjan, Chebrolu, et al.
Publicado: (2025)
por: Niranjan, Chebrolu, et al.
Publicado: (2025)
In-Run Data Shapley for Adam Optimizer
por: Ding, Meng, et al.
Publicado: (2026)
por: Ding, Meng, et al.
Publicado: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
por: Cheng, Zifeng, et al.
Publicado: (2025)
por: Cheng, Zifeng, et al.
Publicado: (2025)
Multi-Adapter Representation Interventions via Energy Calibration
por: Yu, Manjiang, et al.
Publicado: (2026)
por: Yu, Manjiang, et al.
Publicado: (2026)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
por: Oozeer, Narmeen, et al.
Publicado: (2025)
por: Oozeer, Narmeen, et al.
Publicado: (2025)
On Effects of Steering Latent Representation for Large Language Model Unlearning
por: Huu-Tien, Dang, et al.
Publicado: (2024)
por: Huu-Tien, Dang, et al.
Publicado: (2024)
Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models
por: Li, Hongji, et al.
Publicado: (2025)
por: Li, Hongji, et al.
Publicado: (2025)
On Diversified Preferences of Large Language Model Alignment
por: Zeng, Dun, et al.
Publicado: (2023)
por: Zeng, Dun, et al.
Publicado: (2023)
Dialectical Alignment: Resolving the Tension of 3H and Security Threats of LLMs
por: Yang, Shu, et al.
Publicado: (2024)
por: Yang, Shu, et al.
Publicado: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
por: Wang, Chaoqi, et al.
Publicado: (2025)
por: Wang, Chaoqi, et al.
Publicado: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025)
por: Zhang, Songming, et al.
Publicado: (2025)
Ejemplares similares
-
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026) -
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
por: You, Liangliang, et al.
Publicado: (2025) -
PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration
por: Yu, Manjiang, et al.
Publicado: (2025) -
Beyond Scalars: Evaluating and Understanding LLM Reasoning via Geometric Progress and Stability
por: Jiang, Xinyan, et al.
Publicado: (2026) -
Functional Subspace Watermarking for Large Language Models
por: Ding, Zikang, et al.
Publicado: (2026)