ExpertLens: Activation steering features are highly interpretable
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fedzechkina, Masha, Gualdoni, Eleonora, Williamson, Sinead, Metcalf, Katherine, Seto, Skyler, Theobald, Barry-John |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
par: Sundar, Anirudh, et autres
Publié: (2025)
par: Sundar, Anirudh, et autres
Publié: (2025)
What do your logits know? (The answer may surprise you!)
par: Fedzechkina, Masha, et autres
Publié: (2026)
par: Fedzechkina, Masha, et autres
Publié: (2026)
LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss
par: Rodriguez, Pau, et autres
Publié: (2025)
par: Rodriguez, Pau, et autres
Publié: (2025)
Investigating Intersectional Bias in Large Language Models using Confidence Disparities in Coreference Resolution
par: Khan, Falaah Arif, et autres
Publié: (2025)
par: Khan, Falaah Arif, et autres
Publié: (2025)
Discriminating Form and Meaning in Multilingual Models with Minimal-Pair ABX Tasks
par: de Seyssel, Maureen, et autres
Publié: (2025)
par: de Seyssel, Maureen, et autres
Publié: (2025)
PREDICT: Preference Reasoning by Evaluating Decomposed preferences Inferred from Candidate Trajectories
par: Aroca-Ouellette, Stephane, et autres
Publié: (2024)
par: Aroca-Ouellette, Stephane, et autres
Publié: (2024)
Whispering Experts: Neural Interventions for Toxicity Mitigation in Language Models
par: Suau, Xavier, et autres
Publié: (2024)
par: Suau, Xavier, et autres
Publié: (2024)
Can sparse autoencoders be used to decompose and interpret steering vectors?
par: Mayne, Harry, et autres
Publié: (2024)
par: Mayne, Harry, et autres
Publié: (2024)
Sample-Efficient Preference-based Reinforcement Learning with Dynamics Aware Rewards
par: Metcalf, Katherine, et autres
Publié: (2024)
par: Metcalf, Katherine, et autres
Publié: (2024)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
par: Lin, Yong, et autres
Publié: (2024)
par: Lin, Yong, et autres
Publié: (2024)
DSO: Direct Steering Optimization for Bias Mitigation
par: Paes, Lucas Monteiro, et autres
Publié: (2025)
par: Paes, Lucas Monteiro, et autres
Publié: (2025)
Is Your Model Fairly Certain? Uncertainty-Aware Fairness Evaluation for LLMs
par: Wang, Yinong Oliver, et autres
Publié: (2025)
par: Wang, Yinong Oliver, et autres
Publié: (2025)
Why do objects have many names? A study on word informativeness in language use and lexical systems
par: Gualdoni, Eleonora, et autres
Publié: (2024)
par: Gualdoni, Eleonora, et autres
Publié: (2024)
Analyzing the Effect of Linguistic Similarity on Cross-Lingual Transfer: Tasks and Experimental Setups Matter
par: Blaschke, Verena, et autres
Publié: (2025)
par: Blaschke, Verena, et autres
Publié: (2025)
Aligning LLMs by Predicting Preferences from User Writing Samples
par: Aroca-Ouellette, Stéphane, et autres
Publié: (2025)
par: Aroca-Ouellette, Stéphane, et autres
Publié: (2025)
RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems
par: Friel, Robert, et autres
Publié: (2024)
par: Friel, Robert, et autres
Publié: (2024)
Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models
par: Mackraz, Natalie, et autres
Publié: (2024)
par: Mackraz, Natalie, et autres
Publié: (2024)
Enabling Precise Topic Alignment in Large Language Models Via Sparse Autoencoders
par: Joshi, Ananya, et autres
Publié: (2025)
par: Joshi, Ananya, et autres
Publié: (2025)
Exploring and steering the moral compass of Large Language Models
par: Tlaie, Alejandro
Publié: (2024)
par: Tlaie, Alejandro
Publié: (2024)
Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost
par: Belyi, Masha, et autres
Publié: (2024)
par: Belyi, Masha, et autres
Publié: (2024)
Reasoning's Razor: Reasoning Improves Accuracy but Can Hurt Recall at Critical Operating Points in Safety and Hallucination Detection
par: Chegini, Atoosa, et autres
Publié: (2025)
par: Chegini, Atoosa, et autres
Publié: (2025)
Revisiting Uncertainty Quantification Evaluation in Language Models: Spurious Interactions with Response Length Bias Results
par: Santilli, Andrea, et autres
Publié: (2025)
par: Santilli, Andrea, et autres
Publié: (2025)
SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?
par: Kirchhof, Michael, et autres
Publié: (2025)
par: Kirchhof, Michael, et autres
Publié: (2025)
Navigating through the hidden embedding space: steering LLMs to improve mental health assessment
par: Ravenda, Federico, et autres
Publié: (2025)
par: Ravenda, Federico, et autres
Publié: (2025)
Toward universal steering and monitoring of AI models
par: Beaglehole, Daniel, et autres
Publié: (2025)
par: Beaglehole, Daniel, et autres
Publié: (2025)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
par: Liu, Baihui, et autres
Publié: (2026)
par: Liu, Baihui, et autres
Publié: (2026)
BED-LLM: Intelligent Information Gathering with LLMs and Bayesian Experimental Design
par: Choudhury, Deepro, et autres
Publié: (2025)
par: Choudhury, Deepro, et autres
Publié: (2025)
Closing the Gap Between Text and Speech Understanding in LLMs
par: Cuervo, Santiago, et autres
Publié: (2025)
par: Cuervo, Santiago, et autres
Publié: (2025)
StructLens: A Structural Lens for Language Models via Maximum Spanning Trees
par: Sakajo, Haruki, et autres
Publié: (2026)
par: Sakajo, Haruki, et autres
Publié: (2026)
Localizing Persona Representations in LLMs
par: Cintas, Celia, et autres
Publié: (2025)
par: Cintas, Celia, et autres
Publié: (2025)
Automating Historical Insight Extraction from Large-Scale Newspaper Archives via Neural Topic Modeling
par: Murugaraj, Keerthana, et autres
Publié: (2025)
par: Murugaraj, Keerthana, et autres
Publié: (2025)
Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging
par: Ablin, Pierre, et autres
Publié: (2025)
par: Ablin, Pierre, et autres
Publié: (2025)
HalluLens: LLM Hallucination Benchmark
par: Bang, Yejin, et autres
Publié: (2025)
par: Bang, Yejin, et autres
Publié: (2025)
FaithLens: Detecting and Explaining Faithfulness Hallucination
par: Si, Shuzheng, et autres
Publié: (2025)
par: Si, Shuzheng, et autres
Publié: (2025)
Rectifying LLM Thought from Lens of Optimization
par: Liu, Junnan, et autres
Publié: (2025)
par: Liu, Junnan, et autres
Publié: (2025)
ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
ExpertQA: Expert-Curated Questions and Attributed Answers
par: Malaviya, Chaitanya, et autres
Publié: (2023)
par: Malaviya, Chaitanya, et autres
Publié: (2023)
An Expert is Worth One Token: Synergizing Multiple Expert LLMs as Generalist via Expert Token Routing
par: Chai, Ziwei, et autres
Publié: (2024)
par: Chai, Ziwei, et autres
Publié: (2024)
FMEA Builder: Expert Guided Text Generation for Equipment Maintenance
par: Lynch, Karol, et autres
Publié: (2024)
par: Lynch, Karol, et autres
Publié: (2024)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
par: Xu, Benfeng, et autres
Publié: (2023)
par: Xu, Benfeng, et autres
Publié: (2023)
Documents similaires
-
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
par: Sundar, Anirudh, et autres
Publié: (2025) -
What do your logits know? (The answer may surprise you!)
par: Fedzechkina, Masha, et autres
Publié: (2026) -
LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss
par: Rodriguez, Pau, et autres
Publié: (2025) -
Investigating Intersectional Bias in Large Language Models using Confidence Disparities in Coreference Resolution
par: Khan, Falaah Arif, et autres
Publié: (2025) -
Discriminating Form and Meaning in Multilingual Models with Minimal-Pair ABX Tasks
par: de Seyssel, Maureen, et autres
Publié: (2025)