DISCO: Disentangled Communication Steering for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Torop, Max, Masoomi, Aria, Eskandar, Masih, Dy, Jennifer |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Boundary-Aware Uncertainty for Feature Attribution Explainers
by: Hill, Davin, et al.
Published: (2022)
by: Hill, Davin, et al.
Published: (2022)
Axiomatic Explainer Globalness via Optimal Transport
by: Hill, Davin, et al.
Published: (2024)
by: Hill, Davin, et al.
Published: (2024)
Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study
by: Torop, Max, et al.
Published: (2025)
by: Torop, Max, et al.
Published: (2025)
ADAPT to Robustify Prompt Tuning Vision Transformers
by: Eskandar, Masih, et al.
Published: (2024)
by: Eskandar, Masih, et al.
Published: (2024)
Analyzing Explainer Robustness via Probabilistic Lipschitzness of Prediction Functions
by: Khan, Zulqarnain, et al.
Published: (2022)
by: Khan, Zulqarnain, et al.
Published: (2022)
STAR: Stability-Inducing Weight Perturbation for Continual Learning
by: Eskandar, Masih, et al.
Published: (2025)
by: Eskandar, Masih, et al.
Published: (2025)
OrdShap: Feature Position Importance for Sequential Black-Box Models
by: Hill, Davin, et al.
Published: (2025)
by: Hill, Davin, et al.
Published: (2025)
DISCO: Diversifying Sample Condensation for Efficient Model Evaluation
by: Rubinstein, Alexander, et al.
Published: (2025)
by: Rubinstein, Alexander, et al.
Published: (2025)
Compositional Steering of Large Language Models with Steering Tokens
by: Radevski, Gorjan, et al.
Published: (2026)
by: Radevski, Gorjan, et al.
Published: (2026)
Assessing Lower Limb Strength using Internet-of-Things Enabled Chair
by: Yeh, Chelsea, et al.
Published: (2022)
by: Yeh, Chelsea, et al.
Published: (2022)
Differentially Private Steering for Large Language Model Alignment
by: Goel, Anmol, et al.
Published: (2025)
by: Goel, Anmol, et al.
Published: (2025)
Steering Large Language Model Activations in Sparse Spaces
by: Bayat, Reza, et al.
Published: (2025)
by: Bayat, Reza, et al.
Published: (2025)
On the Non-Identifiability of Steering Vectors in Large Language Models
by: Venkatesh, Sohan, et al.
Published: (2026)
by: Venkatesh, Sohan, et al.
Published: (2026)
Dependency-aware Maximum Likelihood Estimation for Active Learning
by: Kalkanli, Beyza, et al.
Published: (2025)
by: Kalkanli, Beyza, et al.
Published: (2025)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
by: Cao, Yuanpu, et al.
Published: (2024)
by: Cao, Yuanpu, et al.
Published: (2024)
Steering Protein Language Models
by: Huang, Long-Kai, et al.
Published: (2025)
by: Huang, Long-Kai, et al.
Published: (2025)
Steering Large Language Models for Machine Translation Personalization
by: Scalena, Daniel, et al.
Published: (2025)
by: Scalena, Daniel, et al.
Published: (2025)
DISCO: A Browser-Based Privacy-Preserving Framework for Distributed Collaborative Learning
by: Vignoud, Julien T. T., et al.
Published: (2025)
by: Vignoud, Julien T. T., et al.
Published: (2025)
DISCO: An End-to-End Bandit Framework for Personalised Discount Allocation
by: Zhang, Jason Shuo, et al.
Published: (2024)
by: Zhang, Jason Shuo, et al.
Published: (2024)
InnerThoughts: Disentangling Representations and Predictions in Large Language Models
by: Chételat, Didier, et al.
Published: (2025)
by: Chételat, Didier, et al.
Published: (2025)
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
by: Hedström, Anna, et al.
Published: (2025)
by: Hedström, Anna, et al.
Published: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
by: Sharma, Kartik, et al.
Published: (2026)
by: Sharma, Kartik, et al.
Published: (2026)
Steering Language Model Refusal with Sparse Autoencoders
by: O'Brien, Kyle, et al.
Published: (2024)
by: O'Brien, Kyle, et al.
Published: (2024)
ChronoSteer: Bridging Large Language Model and Time Series Foundation Model via Synthetic Data
by: Wang, Chengsen, et al.
Published: (2025)
by: Wang, Chengsen, et al.
Published: (2025)
Disentangling Exploration of Large Language Models by Optimal Exploitation
by: Grams, Tim, et al.
Published: (2025)
by: Grams, Tim, et al.
Published: (2025)
DISCO: learning to DISCover an evolution Operator for multi-physics-agnostic prediction
by: Morel, Rudy, et al.
Published: (2025)
by: Morel, Rudy, et al.
Published: (2025)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
by: Weng, Zixuan, et al.
Published: (2026)
by: Weng, Zixuan, et al.
Published: (2026)
LVT: Large-Scale Scene Reconstruction via Local View Transformers
by: Imtiaz, Tooba, et al.
Published: (2025)
by: Imtiaz, Tooba, et al.
Published: (2025)
Accelerating Feedback-based Algorithms for Quantum Optimization Using Gradient Descent
by: Mozakka, Masih, et al.
Published: (2026)
by: Mozakka, Masih, et al.
Published: (2026)
Disentangled Representation Learning with Large Language Models for Text-Attributed Graphs
by: Qin, Yijian, et al.
Published: (2023)
by: Qin, Yijian, et al.
Published: (2023)
Depth-Wise Activation Steering for Honest Language Models
by: Góral, Gracjan, et al.
Published: (2025)
by: Góral, Gracjan, et al.
Published: (2025)
Understanding (Un)Reliability of Steering Vectors in Language Models
by: Braun, Joschka, et al.
Published: (2025)
by: Braun, Joschka, et al.
Published: (2025)
Steering Language Models with Weight Arithmetic
by: Fierro, Constanza, et al.
Published: (2025)
by: Fierro, Constanza, et al.
Published: (2025)
Steering Language Models With Activation Engineering
by: Turner, Alexander Matt, et al.
Published: (2023)
by: Turner, Alexander Matt, et al.
Published: (2023)
Quantum Large Language Models via Tensor Network Disentanglers
by: Aizpurua, Borja, et al.
Published: (2024)
by: Aizpurua, Borja, et al.
Published: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
by: Soo, Samuel, et al.
Published: (2025)
by: Soo, Samuel, et al.
Published: (2025)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
by: Scalena, Daniel, et al.
Published: (2024)
by: Scalena, Daniel, et al.
Published: (2024)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
by: Anand, Nikhil, et al.
Published: (2026)
by: Anand, Nikhil, et al.
Published: (2026)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
by: Huo, Yifu, et al.
Published: (2026)
by: Huo, Yifu, et al.
Published: (2026)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
by: Wu, Jialin, et al.
Published: (2026)
by: Wu, Jialin, et al.
Published: (2026)
Similar Items
-
Boundary-Aware Uncertainty for Feature Attribution Explainers
by: Hill, Davin, et al.
Published: (2022) -
Axiomatic Explainer Globalness via Optimal Transport
by: Hill, Davin, et al.
Published: (2024) -
Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study
by: Torop, Max, et al.
Published: (2025) -
ADAPT to Robustify Prompt Tuning Vision Transformers
by: Eskandar, Masih, et al.
Published: (2024) -
Analyzing Explainer Robustness via Probabilistic Lipschitzness of Prediction Functions
by: Khan, Zulqarnain, et al.
Published: (2022)