Flash Interpretability: Decoding Specialised Feature Neurons in Large Language Models with the LM-Head
Fuente:
arXiv
Guardado en:
| Autor principal: | Davies, Harry J |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FlashDecoding++: Faster Large Language Model Inference on GPUs
por: Hong, Ke, et al.
Publicado: (2023)
por: Hong, Ke, et al.
Publicado: (2023)
Specialised or Generic? Tokenization Choices for Radiology Language Models
por: Warr, Hermione, et al.
Publicado: (2025)
por: Warr, Hermione, et al.
Publicado: (2025)
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
por: Yu, Zeping, et al.
Publicado: (2024)
por: Yu, Zeping, et al.
Publicado: (2024)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
por: Plaksin, Anton, et al.
Publicado: (2026)
por: Plaksin, Anton, et al.
Publicado: (2026)
Replicating ReLM Results: Validating Large Language Models with ReLM
por: Adamson, Reece, et al.
Publicado: (2025)
por: Adamson, Reece, et al.
Publicado: (2025)
MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model
por: Huo, Jiahao, et al.
Publicado: (2024)
por: Huo, Jiahao, et al.
Publicado: (2024)
Targeted Angular Reversal of Weights (TARS) for Knowledge Removal in Large Language Models
por: Davies, Harry J., et al.
Publicado: (2024)
por: Davies, Harry J., et al.
Publicado: (2024)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
por: Zhang, Weixu, et al.
Publicado: (2026)
por: Zhang, Weixu, et al.
Publicado: (2026)
CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models
por: Liang, Yihao, et al.
Publicado: (2026)
por: Liang, Yihao, et al.
Publicado: (2026)
MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages
por: Lombard, Anri, et al.
Publicado: (2026)
por: Lombard, Anri, et al.
Publicado: (2026)
Automatically Interpreting Millions of Features in Large Language Models
por: Paulo, Gonçalo, et al.
Publicado: (2024)
por: Paulo, Gonçalo, et al.
Publicado: (2024)
DFlash: Block Diffusion for Flash Speculative Decoding
por: Chen, Jian, et al.
Publicado: (2026)
por: Chen, Jian, et al.
Publicado: (2026)
Interpreting Bias in Large Language Models: A Feature-Based Approach
por: Prakash, Nirmalendu, et al.
Publicado: (2024)
por: Prakash, Nirmalendu, et al.
Publicado: (2024)
Constructing Interpretable Features from Compositional Neuron Groups
por: Shafran, Or, et al.
Publicado: (2025)
por: Shafran, Or, et al.
Publicado: (2025)
Unveiling Language Competence Neurons: A Psycholinguistic Approach to Model Interpretability
por: Duan, Xufeng, et al.
Publicado: (2024)
por: Duan, Xufeng, et al.
Publicado: (2024)
Lost in Backpropagation: The LM Head is a Gradient Bottleneck
por: Godey, Nathan, et al.
Publicado: (2026)
por: Godey, Nathan, et al.
Publicado: (2026)
On Relation-Specific Neurons in Large Language Models
por: Liu, Yihong, et al.
Publicado: (2025)
por: Liu, Yihong, et al.
Publicado: (2025)
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
por: Jiao, Cathy, et al.
Publicado: (2025)
por: Jiao, Cathy, et al.
Publicado: (2025)
Improving Neuron-level Interpretability with White-box Language Models
por: Bai, Hao, et al.
Publicado: (2024)
por: Bai, Hao, et al.
Publicado: (2024)
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models
por: Liu, Yan, et al.
Publicado: (2024)
por: Liu, Yan, et al.
Publicado: (2024)
Let's Focus on Neuron: Neuron-Level Supervised Fine-tuning for Large Language Model
por: Xu, Haoyun, et al.
Publicado: (2024)
por: Xu, Haoyun, et al.
Publicado: (2024)
LM2: Large Memory Models
por: Kang, Jikun, et al.
Publicado: (2025)
por: Kang, Jikun, et al.
Publicado: (2025)
On the Multilingual Ability of Decoder-based Pre-trained Language Models: Finding and Controlling Language-Specific Neurons
por: Kojima, Takeshi, et al.
Publicado: (2024)
por: Kojima, Takeshi, et al.
Publicado: (2024)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
por: Tang, Shengkun, et al.
Publicado: (2025)
por: Tang, Shengkun, et al.
Publicado: (2025)
CogLM: Tracking Cognitive Development of Large Language Models
por: Wang, Xinglin, et al.
Publicado: (2024)
por: Wang, Xinglin, et al.
Publicado: (2024)
Isolating Culture Neurons in Multilingual Large Language Models
por: Namazifard, Danial, et al.
Publicado: (2025)
por: Namazifard, Danial, et al.
Publicado: (2025)
InternLM-Law: An Open Source Chinese Legal Large Language Model
por: Fei, Zhiwei, et al.
Publicado: (2024)
por: Fei, Zhiwei, et al.
Publicado: (2024)
SaulLM-7B: A pioneering Large Language Model for Law
por: Colombo, Pierre, et al.
Publicado: (2024)
por: Colombo, Pierre, et al.
Publicado: (2024)
ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting
por: Cheng, Xiaoxue, et al.
Publicado: (2024)
por: Cheng, Xiaoxue, et al.
Publicado: (2024)
Neuron-Level Sequential Editing for Large Language Models
por: Jiang, Houcheng, et al.
Publicado: (2024)
por: Jiang, Houcheng, et al.
Publicado: (2024)
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
por: Zhang, Biao, et al.
Publicado: (2025)
por: Zhang, Biao, et al.
Publicado: (2025)
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models
por: Tang, Tianyi, et al.
Publicado: (2024)
por: Tang, Tianyi, et al.
Publicado: (2024)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
por: Wang, Qidong, et al.
Publicado: (2026)
por: Wang, Qidong, et al.
Publicado: (2026)
KEDRec-LM: A Knowledge-distilled Explainable Drug Recommendation Large Language Model
por: Zhang, Kai, et al.
Publicado: (2025)
por: Zhang, Kai, et al.
Publicado: (2025)
SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
por: Ge, Yuan, et al.
Publicado: (2025)
por: Ge, Yuan, et al.
Publicado: (2025)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
por: Ying, Huaiyuan, et al.
Publicado: (2024)
por: Ying, Huaiyuan, et al.
Publicado: (2024)
Neuron-Level Analysis of Cultural Understanding in Large Language Models
por: Yamamoto, Taisei, et al.
Publicado: (2025)
por: Yamamoto, Taisei, et al.
Publicado: (2025)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
por: Zhu, Lianghui, et al.
Publicado: (2023)
por: Zhu, Lianghui, et al.
Publicado: (2023)
Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph
por: Vashurin, Roman, et al.
Publicado: (2024)
por: Vashurin, Roman, et al.
Publicado: (2024)
Neuron-based Personality Trait Induction in Large Language Models
por: Deng, Jia, et al.
Publicado: (2024)
por: Deng, Jia, et al.
Publicado: (2024)
Ejemplares similares
-
FlashDecoding++: Faster Large Language Model Inference on GPUs
por: Hong, Ke, et al.
Publicado: (2023) -
Specialised or Generic? Tokenization Choices for Radiology Language Models
por: Warr, Hermione, et al.
Publicado: (2025) -
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
por: Yu, Zeping, et al.
Publicado: (2024) -
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
por: Plaksin, Anton, et al.
Publicado: (2026) -
Replicating ReLM Results: Validating Large Language Models with ReLM
por: Adamson, Reece, et al.
Publicado: (2025)