SAFR: Neuron Redistribution for Interpretability
Fuente:
arXiv
Guardado en:
| Autores principales: | Chang, Ruidi, Deng, Chunyuan, Chen, Hanjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language Models are Symbolic Learners in Arithmetic
por: Deng, Chunyuan, et al.
Publicado: (2024)
por: Deng, Chunyuan, et al.
Publicado: (2024)
Learning Distribution-Wise Control in Representation Space for Language Models
por: Deng, Chunyuan, et al.
Publicado: (2025)
por: Deng, Chunyuan, et al.
Publicado: (2025)
Steering Information Utility in Key-Value Memory for Language Model Post-Training
por: Deng, Chunyuan, et al.
Publicado: (2025)
por: Deng, Chunyuan, et al.
Publicado: (2025)
The Generalization Ridge: Information Flow in Natural Language Generation
por: Chang, Ruidi, et al.
Publicado: (2025)
por: Chang, Ruidi, et al.
Publicado: (2025)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
por: Yan, Ge, et al.
Publicado: (2025)
por: Yan, Ge, et al.
Publicado: (2025)
In Search of Grandmother Cells: Tracing Interpretable Neurons in Tabular Representations
por: Knauer, Ricardo, et al.
Publicado: (2026)
por: Knauer, Ricardo, et al.
Publicado: (2026)
Spherical Steering: Geometry-Aware Activation Rotation for Language Models
por: You, Zejia, et al.
Publicado: (2026)
por: You, Zejia, et al.
Publicado: (2026)
TreeAdv: Tree-Structured Advantage Redistribution for Group-Based RL
por: Cao, Lang, et al.
Publicado: (2026)
por: Cao, Lang, et al.
Publicado: (2026)
NeuronSeek: On Stability and Expressivity of Task-driven Neurons
por: Pei, Hanyu, et al.
Publicado: (2025)
por: Pei, Hanyu, et al.
Publicado: (2025)
Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity
por: Muni, Aneri, et al.
Publicado: (2026)
por: Muni, Aneri, et al.
Publicado: (2026)
Shapley Neuron Values for Continual Learning: Which Neurons Matter Most?
por: Vahedifar, Mohammad Ali, et al.
Publicado: (2026)
por: Vahedifar, Mohammad Ali, et al.
Publicado: (2026)
Artificial Kuramoto Oscillatory Neurons
por: Miyato, Takeru, et al.
Publicado: (2024)
por: Miyato, Takeru, et al.
Publicado: (2024)
Rethinking the Function of Neurons in KANs
por: Altarabichi, Mohammed Ghaith
Publicado: (2024)
por: Altarabichi, Mohammed Ghaith
Publicado: (2024)
Model Fusion via Neuron Transplantation
por: Öz, Muhammed, et al.
Publicado: (2025)
por: Öz, Muhammed, et al.
Publicado: (2025)
LLM Advertisement based on Neuron Auctions
por: Yun, Peiran, et al.
Publicado: (2026)
por: Yun, Peiran, et al.
Publicado: (2026)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
por: Sawmya, Shashata, et al.
Publicado: (2024)
por: Sawmya, Shashata, et al.
Publicado: (2024)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
por: Chen, Sihan, et al.
Publicado: (2025)
por: Chen, Sihan, et al.
Publicado: (2025)
REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
por: Li, Bo, et al.
Publicado: (2025)
por: Li, Bo, et al.
Publicado: (2025)
Explaining the Unexplained: Revealing Hidden Correlations for Better Interpretability
por: Jiang, Wen-Dong, et al.
Publicado: (2024)
por: Jiang, Wen-Dong, et al.
Publicado: (2024)
Neuronal Attention Circuit (NAC) for Representation Learning
por: Razzaq, Waleed, et al.
Publicado: (2025)
por: Razzaq, Waleed, et al.
Publicado: (2025)
Harnessing Neuron Stability to Improve DNN Verification
por: Duong, Hai, et al.
Publicado: (2024)
por: Duong, Hai, et al.
Publicado: (2024)
Accelerating Training with Neuron Interaction and Nowcasting Networks
por: Knyazev, Boris, et al.
Publicado: (2024)
por: Knyazev, Boris, et al.
Publicado: (2024)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
por: Pei, Zehua, et al.
Publicado: (2024)
por: Pei, Zehua, et al.
Publicado: (2024)
DeepSelective: Interpretable Prognosis Prediction via Feature Selection and Compression in EHR Data
por: Zhang, Ruochi, et al.
Publicado: (2025)
por: Zhang, Ruochi, et al.
Publicado: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
por: Pan, Birong, et al.
Publicado: (2025)
por: Pan, Birong, et al.
Publicado: (2025)
Automatically Finding Rule-Based Neurons in OthelloGPT
por: Singh, Aditya, et al.
Publicado: (2025)
por: Singh, Aditya, et al.
Publicado: (2025)
MIN-Merging: Merge the Important Neurons for Model Merging
por: Liang, Yunfei
Publicado: (2025)
por: Liang, Yunfei
Publicado: (2025)
SYNAPSE: Framework for Neuron Analysis and Perturbation in Sequence Encoding
por: Ochoa, Jesús Sánchez, et al.
Publicado: (2026)
por: Ochoa, Jesús Sánchez, et al.
Publicado: (2026)
DPCformer: An Interpretable Deep Learning Model for Genomic Prediction in Crops
por: Deng, Pengcheng, et al.
Publicado: (2025)
por: Deng, Pengcheng, et al.
Publicado: (2025)
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
por: Kapoor, Aditya, et al.
Publicado: (2025)
por: Kapoor, Aditya, et al.
Publicado: (2025)
ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging
por: Feng, Zhuoka, et al.
Publicado: (2026)
por: Feng, Zhuoka, et al.
Publicado: (2026)
Neuronal Stochastic Attention Circuit (NSAC) for Probabilistic Representation Learning
por: Razzaq, Waleed, et al.
Publicado: (2026)
por: Razzaq, Waleed, et al.
Publicado: (2026)
Maxwell's Demon at Work: Efficient Pruning by Leveraging Saturation of Neurons
por: Dufort-Labbé, Simon, et al.
Publicado: (2024)
por: Dufort-Labbé, Simon, et al.
Publicado: (2024)
Expressiveness of Multi-Neuron Convex Relaxations in Neural Network Certification
por: Mao, Yuhao, et al.
Publicado: (2024)
por: Mao, Yuhao, et al.
Publicado: (2024)
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
por: Haider, Muhammad Umair, et al.
Publicado: (2025)
por: Haider, Muhammad Umair, et al.
Publicado: (2025)
Simple Hierarchical Planning with Diffusion
por: Chen, Chang, et al.
Publicado: (2024)
por: Chen, Chang, et al.
Publicado: (2024)
Explanation-Guided Adversarial Training for Robust and Interpretable Models
por: Chen, Chao, et al.
Publicado: (2026)
por: Chen, Chao, et al.
Publicado: (2026)
Neuron-level Balance between Stability and Plasticity in Deep Reinforcement Learning
por: Lan, Jiahua, et al.
Publicado: (2025)
por: Lan, Jiahua, et al.
Publicado: (2025)
Dendritic Resonate-and-Fire Neuron for Effective and Efficient Long Sequence Modeling
por: Zhang, Dehao, et al.
Publicado: (2025)
por: Zhang, Dehao, et al.
Publicado: (2025)
Lie Neurons: Adjoint-Equivariant Neural Networks for Semisimple Lie Algebras
por: Lin, Tzu-Yuan, et al.
Publicado: (2023)
por: Lin, Tzu-Yuan, et al.
Publicado: (2023)
Ejemplares similares
-
Language Models are Symbolic Learners in Arithmetic
por: Deng, Chunyuan, et al.
Publicado: (2024) -
Learning Distribution-Wise Control in Representation Space for Language Models
por: Deng, Chunyuan, et al.
Publicado: (2025) -
Steering Information Utility in Key-Value Memory for Language Model Post-Training
por: Deng, Chunyuan, et al.
Publicado: (2025) -
The Generalization Ridge: Information Flow in Natural Language Generation
por: Chang, Ruidi, et al.
Publicado: (2025) -
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
por: Yan, Ge, et al.
Publicado: (2025)