Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Haotian, Yang, Jiannan, Gao, Tian, Weng, Tsui-Wei, Ma, Tengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Graph Concept Bottleneck Models
par: Xu, Haotian, et autres
Publié: (2025)
par: Xu, Haotian, et autres
Publié: (2025)
Linear Explanations for Individual Neurons
par: Oikarinen, Tuomas, et autres
Publié: (2024)
par: Oikarinen, Tuomas, et autres
Publié: (2024)
Evaluating Neuron Explanations: A Unified Framework with Sanity Checks
par: Oikarinen, Tuomas, et autres
Publié: (2025)
par: Oikarinen, Tuomas, et autres
Publié: (2025)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
par: Yan, Ge, et autres
Publié: (2025)
par: Yan, Ge, et autres
Publié: (2025)
When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected
par: Xu, Haotian, et autres
Publié: (2025)
par: Xu, Haotian, et autres
Publié: (2025)
Joint Training Across Multiple Activation Sparsity Regimes
par: Wang, Haotian
Publié: (2026)
par: Wang, Haotian
Publié: (2026)
Self-Supervised Learning on Molecular Graphs: A Systematic Investigation of Masking Design
par: Yang, Jiannan, et autres
Publié: (2025)
par: Yang, Jiannan, et autres
Publié: (2025)
Abstracted Shapes as Tokens -- A Generalizable and Interpretable Model for Time-series Classification
par: Wen, Yunshi, et autres
Publié: (2024)
par: Wen, Yunshi, et autres
Publié: (2024)
Interpreting Neurons in Deep Vision Networks with Language Models
par: Bai, Nicholas, et autres
Publié: (2024)
par: Bai, Nicholas, et autres
Publié: (2024)
Efficient Imputation for Patch-based Missing Single-cell Data via Cluster-regularized Optimal Transport
par: Liu, Yuyu, et autres
Publié: (2026)
par: Liu, Yuyu, et autres
Publié: (2026)
Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability
par: Oikarinen, Tuomas, et autres
Publié: (2025)
par: Oikarinen, Tuomas, et autres
Publié: (2025)
To 2:4 Sparsity and Beyond: Neuron-level Activation Function to Accelerate LLM Pre-Training
par: Madhyastha, Meghana, et autres
Publié: (2026)
par: Madhyastha, Meghana, et autres
Publié: (2026)
Breaking the Barrier: Enhanced Utility and Robustness in Smoothed DRL Agents
par: Sun, Chung-En, et autres
Publié: (2024)
par: Sun, Chung-En, et autres
Publié: (2024)
Neuron Activation Coverage: Rethinking Out-of-distribution Detection and Generalization
par: Liu, Yibing, et autres
Publié: (2023)
par: Liu, Yibing, et autres
Publié: (2023)
Towards the Connection between Activation Sparsity and Flat Minima
par: Peng, Ze, et autres
Publié: (2026)
par: Peng, Ze, et autres
Publié: (2026)
Distillation Robustifies Unlearning
par: Lee, Bruce W., et autres
Publié: (2025)
par: Lee, Bruce W., et autres
Publié: (2025)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
par: Sawmya, Shashata, et autres
Publié: (2024)
par: Sawmya, Shashata, et autres
Publié: (2024)
ProTransformer: Robustify Transformers via Plug-and-Play Paradigm
par: Hou, Zhichao, et autres
Publié: (2024)
par: Hou, Zhichao, et autres
Publié: (2024)
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
par: Sun, Chung-En, et autres
Publié: (2024)
par: Sun, Chung-En, et autres
Publié: (2024)
RAT: Boosting Misclassification Detection Ability without Extra Data
par: Yan, Ge, et autres
Publié: (2025)
par: Yan, Ge, et autres
Publié: (2025)
Interpretability-Guided Test-Time Adversarial Defense
par: Kulkarni, Akshay, et autres
Publié: (2024)
par: Kulkarni, Akshay, et autres
Publié: (2024)
DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs
par: Yin, Ruokai, et autres
Publié: (2025)
par: Yin, Ruokai, et autres
Publié: (2025)
Understanding Fixed Predictions via Confined Regions
par: Lawless, Connor, et autres
Publié: (2025)
par: Lawless, Connor, et autres
Publié: (2025)
R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference
par: Zhang, Zhenyu, et autres
Publié: (2025)
par: Zhang, Zhenyu, et autres
Publié: (2025)
Týr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization
par: Li, Guanchen, et autres
Publié: (2025)
par: Li, Guanchen, et autres
Publié: (2025)
Explore Activation Sparsity in Recurrent LLMs for Energy-Efficient Neuromorphic Computing
par: Knunyants, Ivan, et autres
Publié: (2025)
par: Knunyants, Ivan, et autres
Publié: (2025)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
par: Sun, Chung-En, et autres
Publié: (2025)
par: Sun, Chung-En, et autres
Publié: (2025)
Effective Skill Unlearning through Intervention and Abstention
par: Li, Yongce, et autres
Publié: (2025)
par: Li, Yongce, et autres
Publié: (2025)
Crafting Large Language Models for Enhanced Interpretability
par: Sun, Chung-En, et autres
Publié: (2024)
par: Sun, Chung-En, et autres
Publié: (2024)
Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization
par: Pang, Jing-Cheng, et autres
Publié: (2021)
par: Pang, Jing-Cheng, et autres
Publié: (2021)
Robustifying Conditional Portfolio Decisions via Optimal Transport
par: Nguyen, Viet Anh, et autres
Publié: (2021)
par: Nguyen, Viet Anh, et autres
Publié: (2021)
VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance
par: Srivastava, Divyansh, et autres
Publié: (2024)
par: Srivastava, Divyansh, et autres
Publié: (2024)
Task-Specific Data Selection for Instruction Tuning via Monosemantic Neuronal Activations
par: Ma, Da, et autres
Publié: (2025)
par: Ma, Da, et autres
Publié: (2025)
Robustifying and Boosting Training-Free Neural Architecture Search
par: He, Zhenfeng, et autres
Publié: (2024)
par: He, Zhenfeng, et autres
Publié: (2024)
Deep Neural Network Initialization with Sparsity Inducing Activations
par: Price, Ilan, et autres
Publié: (2024)
par: Price, Ilan, et autres
Publié: (2024)
Prediction without Preclusion: Recourse Verification with Reachable Sets
par: Kothari, Avni, et autres
Publié: (2023)
par: Kothari, Avni, et autres
Publié: (2023)
Provably Robust Conformal Prediction with Improved Efficiency
par: Yan, Ge, et autres
Publié: (2024)
par: Yan, Ge, et autres
Publié: (2024)
Robustifying Point Cloud Networks by Refocusing
par: Levi, Meir Yossef, et autres
Publié: (2023)
par: Levi, Meir Yossef, et autres
Publié: (2023)
Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity
par: Guo, Wentao, et autres
Publié: (2024)
par: Guo, Wentao, et autres
Publié: (2024)
SAU: Sparsity-Aware Unlearning for LLMs via Gradient Masking and Importance Redistribution
par: Wang, Yuze, et autres
Publié: (2026)
par: Wang, Yuze, et autres
Publié: (2026)
Documents similaires
-
Graph Concept Bottleneck Models
par: Xu, Haotian, et autres
Publié: (2025) -
Linear Explanations for Individual Neurons
par: Oikarinen, Tuomas, et autres
Publié: (2024) -
Evaluating Neuron Explanations: A Unified Framework with Sanity Checks
par: Oikarinen, Tuomas, et autres
Publié: (2025) -
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
par: Yan, Ge, et autres
Publié: (2025) -
When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected
par: Xu, Haotian, et autres
Publié: (2025)