Flash Interpretability: Decoding Specialised Feature Neurons in Large Language Models with the LM-Head
Fuente:
arXiv
Salvato in:
| Autore principale: | Davies, Harry J |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlashDecoding++: Faster Large Language Model Inference on GPUs
di: Hong, Ke, et al.
Pubblicazione: (2023)
di: Hong, Ke, et al.
Pubblicazione: (2023)
Specialised or Generic? Tokenization Choices for Radiology Language Models
di: Warr, Hermione, et al.
Pubblicazione: (2025)
di: Warr, Hermione, et al.
Pubblicazione: (2025)
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
di: Yu, Zeping, et al.
Pubblicazione: (2024)
di: Yu, Zeping, et al.
Pubblicazione: (2024)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
di: Plaksin, Anton, et al.
Pubblicazione: (2026)
di: Plaksin, Anton, et al.
Pubblicazione: (2026)
Replicating ReLM Results: Validating Large Language Models with ReLM
di: Adamson, Reece, et al.
Pubblicazione: (2025)
di: Adamson, Reece, et al.
Pubblicazione: (2025)
MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model
di: Huo, Jiahao, et al.
Pubblicazione: (2024)
di: Huo, Jiahao, et al.
Pubblicazione: (2024)
Targeted Angular Reversal of Weights (TARS) for Knowledge Removal in Large Language Models
di: Davies, Harry J., et al.
Pubblicazione: (2024)
di: Davies, Harry J., et al.
Pubblicazione: (2024)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
di: Zhang, Weixu, et al.
Pubblicazione: (2026)
di: Zhang, Weixu, et al.
Pubblicazione: (2026)
CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models
di: Liang, Yihao, et al.
Pubblicazione: (2026)
di: Liang, Yihao, et al.
Pubblicazione: (2026)
MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages
di: Lombard, Anri, et al.
Pubblicazione: (2026)
di: Lombard, Anri, et al.
Pubblicazione: (2026)
Automatically Interpreting Millions of Features in Large Language Models
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2024)
DFlash: Block Diffusion for Flash Speculative Decoding
di: Chen, Jian, et al.
Pubblicazione: (2026)
di: Chen, Jian, et al.
Pubblicazione: (2026)
Interpreting Bias in Large Language Models: A Feature-Based Approach
di: Prakash, Nirmalendu, et al.
Pubblicazione: (2024)
di: Prakash, Nirmalendu, et al.
Pubblicazione: (2024)
Constructing Interpretable Features from Compositional Neuron Groups
di: Shafran, Or, et al.
Pubblicazione: (2025)
di: Shafran, Or, et al.
Pubblicazione: (2025)
Unveiling Language Competence Neurons: A Psycholinguistic Approach to Model Interpretability
di: Duan, Xufeng, et al.
Pubblicazione: (2024)
di: Duan, Xufeng, et al.
Pubblicazione: (2024)
Lost in Backpropagation: The LM Head is a Gradient Bottleneck
di: Godey, Nathan, et al.
Pubblicazione: (2026)
di: Godey, Nathan, et al.
Pubblicazione: (2026)
On Relation-Specific Neurons in Large Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
di: Jiao, Cathy, et al.
Pubblicazione: (2025)
di: Jiao, Cathy, et al.
Pubblicazione: (2025)
Improving Neuron-level Interpretability with White-box Language Models
di: Bai, Hao, et al.
Pubblicazione: (2024)
di: Bai, Hao, et al.
Pubblicazione: (2024)
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
Let's Focus on Neuron: Neuron-Level Supervised Fine-tuning for Large Language Model
di: Xu, Haoyun, et al.
Pubblicazione: (2024)
di: Xu, Haoyun, et al.
Pubblicazione: (2024)
LM2: Large Memory Models
di: Kang, Jikun, et al.
Pubblicazione: (2025)
di: Kang, Jikun, et al.
Pubblicazione: (2025)
On the Multilingual Ability of Decoder-based Pre-trained Language Models: Finding and Controlling Language-Specific Neurons
di: Kojima, Takeshi, et al.
Pubblicazione: (2024)
di: Kojima, Takeshi, et al.
Pubblicazione: (2024)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
di: Tang, Shengkun, et al.
Pubblicazione: (2025)
di: Tang, Shengkun, et al.
Pubblicazione: (2025)
CogLM: Tracking Cognitive Development of Large Language Models
di: Wang, Xinglin, et al.
Pubblicazione: (2024)
di: Wang, Xinglin, et al.
Pubblicazione: (2024)
Isolating Culture Neurons in Multilingual Large Language Models
di: Namazifard, Danial, et al.
Pubblicazione: (2025)
di: Namazifard, Danial, et al.
Pubblicazione: (2025)
InternLM-Law: An Open Source Chinese Legal Large Language Model
di: Fei, Zhiwei, et al.
Pubblicazione: (2024)
di: Fei, Zhiwei, et al.
Pubblicazione: (2024)
SaulLM-7B: A pioneering Large Language Model for Law
di: Colombo, Pierre, et al.
Pubblicazione: (2024)
di: Colombo, Pierre, et al.
Pubblicazione: (2024)
ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2024)
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2024)
Neuron-Level Sequential Editing for Large Language Models
di: Jiang, Houcheng, et al.
Pubblicazione: (2024)
di: Jiang, Houcheng, et al.
Pubblicazione: (2024)
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
di: Zhang, Biao, et al.
Pubblicazione: (2025)
di: Zhang, Biao, et al.
Pubblicazione: (2025)
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models
di: Tang, Tianyi, et al.
Pubblicazione: (2024)
di: Tang, Tianyi, et al.
Pubblicazione: (2024)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
di: Wang, Qidong, et al.
Pubblicazione: (2026)
di: Wang, Qidong, et al.
Pubblicazione: (2026)
KEDRec-LM: A Knowledge-distilled Explainable Drug Recommendation Large Language Model
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
di: Ge, Yuan, et al.
Pubblicazione: (2025)
di: Ge, Yuan, et al.
Pubblicazione: (2025)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
Neuron-Level Analysis of Cultural Understanding in Large Language Models
di: Yamamoto, Taisei, et al.
Pubblicazione: (2025)
di: Yamamoto, Taisei, et al.
Pubblicazione: (2025)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
di: Zhu, Lianghui, et al.
Pubblicazione: (2023)
di: Zhu, Lianghui, et al.
Pubblicazione: (2023)
Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph
di: Vashurin, Roman, et al.
Pubblicazione: (2024)
di: Vashurin, Roman, et al.
Pubblicazione: (2024)
Neuron-based Personality Trait Induction in Large Language Models
di: Deng, Jia, et al.
Pubblicazione: (2024)
di: Deng, Jia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FlashDecoding++: Faster Large Language Model Inference on GPUs
di: Hong, Ke, et al.
Pubblicazione: (2023) -
Specialised or Generic? Tokenization Choices for Radiology Language Models
di: Warr, Hermione, et al.
Pubblicazione: (2025) -
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
di: Yu, Zeping, et al.
Pubblicazione: (2024) -
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
di: Plaksin, Anton, et al.
Pubblicazione: (2026) -
Replicating ReLM Results: Validating Large Language Models with ReLM
di: Adamson, Reece, et al.
Pubblicazione: (2025)