NeuronScope: A Multi-Agent Framework for Explaining Polysemantic Neurons in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Weiqi, Miao, Yongliang, Zhao, Haiyan, Liu, Yanguang, Du, Mengnan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling
di: Miao, Yongliang, et al.
Pubblicazione: (2026)
di: Miao, Yongliang, et al.
Pubblicazione: (2026)
SAE-FiRE: Enhancing Earnings Surprise Predictions Through Sparse Autoencoder Feature Selection
di: Zhang, Huopu, et al.
Pubblicazione: (2025)
di: Zhang, Huopu, et al.
Pubblicazione: (2025)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
di: Li, Daoyang, et al.
Pubblicazione: (2024)
di: Li, Daoyang, et al.
Pubblicazione: (2024)
Tackling Polysemanticity with Neuron Embeddings
di: Foote, Alex
Pubblicazione: (2024)
di: Foote, Alex
Pubblicazione: (2024)
Universal Activation Verbalizer: A Unified Framework for Cross-Model Activation Explanation
di: Zhao, Haiyan, et al.
Pubblicazione: (2026)
di: Zhao, Haiyan, et al.
Pubblicazione: (2026)
Disentangling Polysemantic Neurons with a Null-Calibrated Polysemanticity Index and Causal Patch Interventions
di: Gupta, Manan, et al.
Pubblicazione: (2025)
di: Gupta, Manan, et al.
Pubblicazione: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework
di: Kopf, Laura, et al.
Pubblicazione: (2025)
di: Kopf, Laura, et al.
Pubblicazione: (2025)
Selective Neuron Amplification in Transformer Language Models
di: Akhtar, Ryyan, et al.
Pubblicazione: (2026)
di: Akhtar, Ryyan, et al.
Pubblicazione: (2026)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Neuron-Level Knowledge Attribution in Large Language Models
di: Yu, Zeping, et al.
Pubblicazione: (2023)
di: Yu, Zeping, et al.
Pubblicazione: (2023)
Finding Culture-Sensitive Neurons in Vision-Language Models
di: Zhao, Xiutian, et al.
Pubblicazione: (2025)
di: Zhao, Xiutian, et al.
Pubblicazione: (2025)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
di: Gu, Jian, et al.
Pubblicazione: (2023)
di: Gu, Jian, et al.
Pubblicazione: (2023)
Learnable Privacy Neurons Localization in Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
Confidence Regulation Neurons in Language Models
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
di: Gerstner, Sebastian, et al.
Pubblicazione: (2026)
di: Gerstner, Sebastian, et al.
Pubblicazione: (2026)
Improving Neuron-level Interpretability with White-box Language Models
di: Bai, Hao, et al.
Pubblicazione: (2024)
di: Bai, Hao, et al.
Pubblicazione: (2024)
Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models
di: Ali, Ameen, et al.
Pubblicazione: (2025)
di: Ali, Ameen, et al.
Pubblicazione: (2025)
Unveiling the Influence of Amplifying Language-Specific Neurons
di: Rahmanisa, Inaya, et al.
Pubblicazione: (2025)
di: Rahmanisa, Inaya, et al.
Pubblicazione: (2025)
Universal Neurons in GPT2 Language Models
di: Gurnee, Wes, et al.
Pubblicazione: (2024)
di: Gurnee, Wes, et al.
Pubblicazione: (2024)
Beyond Single Concept Vector: Modeling Concept Subspace in LLMs with Gaussian Distribution
di: Zhao, Haiyan, et al.
Pubblicazione: (2024)
di: Zhao, Haiyan, et al.
Pubblicazione: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
SPIN: Sparsifying and Integrating Internal Neurons in Large Language Models for Text Classification
di: Jiao, Difan, et al.
Pubblicazione: (2023)
di: Jiao, Difan, et al.
Pubblicazione: (2023)
PURE: Turning Polysemantic Neurons Into Pure Features by Identifying Relevant Circuits
di: Dreyer, Maximilian, et al.
Pubblicazione: (2024)
di: Dreyer, Maximilian, et al.
Pubblicazione: (2024)
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
LawLLM: Law Large Language Model for the US Legal System
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025)
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025)
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
Rep2Text: Decoding Full Text from a Single LLM Token Representation
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
di: Kazemi, Hamid, et al.
Pubblicazione: (2026)
di: Kazemi, Hamid, et al.
Pubblicazione: (2026)
Cross-Model Comparative Loss for Enhancing Neuronal Utility in Language Understanding
di: Zhu, Yunchang, et al.
Pubblicazione: (2023)
di: Zhu, Yunchang, et al.
Pubblicazione: (2023)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
di: Pan, Birong, et al.
Pubblicazione: (2025)
di: Pan, Birong, et al.
Pubblicazione: (2025)
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination
di: Yang, Nakyeong, et al.
Pubblicazione: (2023)
di: Yang, Nakyeong, et al.
Pubblicazione: (2023)
Constructing Interpretable Features from Compositional Neuron Groups
di: Shafran, Or, et al.
Pubblicazione: (2025)
di: Shafran, Or, et al.
Pubblicazione: (2025)
Language-specific Neurons Do Not Facilitate Cross-Lingual Transfer
di: Mondal, Soumen Kumar, et al.
Pubblicazione: (2025)
di: Mondal, Soumen Kumar, et al.
Pubblicazione: (2025)
Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs
di: Liu, Jinzhe, et al.
Pubblicazione: (2025)
di: Liu, Jinzhe, et al.
Pubblicazione: (2025)
Polysemantic Experts, Monosemantic Paths: Routing as Control in MoEs
di: Ye, Charles, et al.
Pubblicazione: (2026)
di: Ye, Charles, et al.
Pubblicazione: (2026)
Knowledge Graph Large Language Model (KG-LLM) for Link Prediction
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling
di: Miao, Yongliang, et al.
Pubblicazione: (2026) -
SAE-FiRE: Enhancing Earnings Surprise Predictions Through Sparse Autoencoder Feature Selection
di: Zhang, Huopu, et al.
Pubblicazione: (2025) -
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
di: Li, Daoyang, et al.
Pubblicazione: (2024) -
Tackling Polysemanticity with Neuron Embeddings
di: Foote, Alex
Pubblicazione: (2024) -
Universal Activation Verbalizer: A Unified Framework for Cross-Model Activation Explanation
di: Zhao, Haiyan, et al.
Pubblicazione: (2026)