NeMo: A Neuron-Level Modularizing-While-Training Approach for Decomposing DNN Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bi, Xiaohan, Qi, Binhang, Sun, Hailong, Gao, Xiang, Yu, Yue, Liang, Xiaojun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Finding NeMo: Localizing Neurons Responsible For Memorization in Diffusion Models
par: Hintersdorf, Dominik, et autres
Publié: (2024)
par: Hintersdorf, Dominik, et autres
Publié: (2024)
Training Video Foundation Models with NVIDIA NeMo
par: Patel, Zeeshan, et autres
Publié: (2025)
par: Patel, Zeeshan, et autres
Publié: (2025)
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
par: Shen, Gerald, et autres
Publié: (2024)
par: Shen, Gerald, et autres
Publié: (2024)
NeMo: Needle in a Montage for Video-Language Understanding
par: Hu, Zi-Yuan, et autres
Publié: (2025)
par: Hu, Zi-Yuan, et autres
Publié: (2025)
CABS: Conflict-Aware and Balanced Sparsification for Enhancing Model Merging
par: Yang, Zongzhen, et autres
Publié: (2025)
par: Yang, Zongzhen, et autres
Publié: (2025)
NeMo-Inspector: A Visualization Tool for LLM Generation Analysis
par: Gitman, Daria, et autres
Publié: (2025)
par: Gitman, Daria, et autres
Publié: (2025)
Finding NeMo: Negative-mined Mosaic Augmentation for Referring Image Segmentation
par: Ha, Seongsu, et autres
Publié: (2024)
par: Ha, Seongsu, et autres
Publié: (2024)
X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
par: Zhao, Xiaochen, et autres
Publié: (2025)
par: Zhao, Xiaochen, et autres
Publié: (2025)
NeMo-map: Neural Implicit Flow Fields for Spatio-Temporal Motion Mapping
par: Zhu, Yufei, et autres
Publié: (2025)
par: Zhu, Yufei, et autres
Publié: (2025)
NeFT: Negative Feedback Training to Improve Robustness of Compute-In-Memory DNN Accelerators
par: Qin, Yifan, et autres
Publié: (2023)
par: Qin, Yifan, et autres
Publié: (2023)
Harnessing Neuron Stability to Improve DNN Verification
par: Duong, Hai, et autres
Publié: (2024)
par: Duong, Hai, et autres
Publié: (2024)
Decomposing Attention To Find Context-Sensitive Neurons
par: Gibson, Alex
Publié: (2025)
par: Gibson, Alex
Publié: (2025)
SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam
par: Peng, Hanyang, et autres
Publié: (2025)
par: Peng, Hanyang, et autres
Publié: (2025)
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
Decomposing the Time Series Forecasting Pipeline: A Modular Approach for Time Series Representation, Information Extraction, and Projection
par: Leppich, Robert, et autres
Publié: (2025)
par: Leppich, Robert, et autres
Publié: (2025)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
par: Yang, Rushuai, et autres
Publié: (2026)
par: Yang, Rushuai, et autres
Publié: (2026)
Mix Q-learning for Lane Changing: A Collaborative Decision-Making Method in Multi-Agent Deep Reinforcement Learning
par: Bi, Xiaojun, et autres
Publié: (2024)
par: Bi, Xiaojun, et autres
Publié: (2024)
Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Neurons for Neutrons: A Transformer Model for Computation Load Estimation on Domain-Decomposed Neutron Transport Problems
par: Mote, Alexander, et autres
Publié: (2024)
par: Mote, Alexander, et autres
Publié: (2024)
M$^3$Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning
par: Yu, Xiaohan, et autres
Publié: (2026)
par: Yu, Xiaohan, et autres
Publié: (2026)
Why Inference in Large Models Becomes Decomposable After Training
par: Jin, Jidong
Publié: (2026)
par: Jin, Jidong
Publié: (2026)
Enabling Large Batch Size Training for DNN Models Beyond the Memory Limit While Maintaining Performance
par: Piao, XinYu, et autres
Publié: (2021)
par: Piao, XinYu, et autres
Publié: (2021)
Enhance DNN Adversarial Robustness and Efficiency via Injecting Noise to Non-Essential Neurons
par: Liu, Zhenyu, et autres
Publié: (2024)
par: Liu, Zhenyu, et autres
Publié: (2024)
Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs
par: Lei, Hang, et autres
Publié: (2025)
par: Lei, Hang, et autres
Publié: (2025)
FourCastNeXt: Optimizing FourCastNet Training for Limited Compute
par: Guo, Edison, et autres
Publié: (2024)
par: Guo, Edison, et autres
Publié: (2024)
Advancing Direct Training for Spiking Neural Networks with Circulate-Firing Neurons and Learnable Gradients
par: Zhou, Feifan, et autres
Publié: (2026)
par: Zhou, Feifan, et autres
Publié: (2026)
Towards Understanding and Enhancing Security of Proof-of-Training for DNN Model Ownership Verification
par: Chang, Yijia, et autres
Publié: (2024)
par: Chang, Yijia, et autres
Publié: (2024)
Investigating White-Box Attacks for On-Device Models
par: Zhou, Mingyi, et autres
Publié: (2024)
par: Zhou, Mingyi, et autres
Publié: (2024)
Identifying Good and Bad Neurons for Task-Level Controllable LLMs
par: Li, Wenjie, et autres
Publié: (2026)
par: Li, Wenjie, et autres
Publié: (2026)
Efficient DNN-Powered Software with Fair Sparse Models
par: Gao, Xuanqi, et autres
Publié: (2024)
par: Gao, Xuanqi, et autres
Publié: (2024)
Decomposing the Neurons: Activation Sparsity via Mixture of Experts for Continual Test Time Adaptation
par: Zhang, Rongyu, et autres
Publié: (2024)
par: Zhang, Rongyu, et autres
Publié: (2024)
GeNeRT: A Physics-Informed Approach to Intelligent Wireless Channel Modeling via Generalizable Neural Ray Tracing
par: Bian, Kejia, et autres
Publié: (2025)
par: Bian, Kejia, et autres
Publié: (2025)
DNN Modularization via Activation-Driven Training
par: Ngo, Tuan, et autres
Publié: (2024)
par: Ngo, Tuan, et autres
Publié: (2024)
NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models
par: Liang, Feng, et autres
Publié: (2025)
par: Liang, Feng, et autres
Publié: (2025)
BadSNN: Backdoor Attacks on Spiking Neural Networks via Adversarial Spiking Neuron
par: Miah, Abdullah Arafat, et autres
Publié: (2026)
par: Miah, Abdullah Arafat, et autres
Publié: (2026)
AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning
par: Mei, Lang, et autres
Publié: (2025)
par: Mei, Lang, et autres
Publié: (2025)
VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
par: Hu, Zengjie, et autres
Publié: (2025)
par: Hu, Zengjie, et autres
Publié: (2025)
Mirage: An RNS-Based Photonic Accelerator for DNN Training
par: Demirkiran, Cansu, et autres
Publié: (2023)
par: Demirkiran, Cansu, et autres
Publié: (2023)
Learning Causal Graphs at Scale: A Foundation Model Approach
par: Yin, Naiyu, et autres
Publié: (2025)
par: Yin, Naiyu, et autres
Publié: (2025)
DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning
par: Guo, Ke, et autres
Publié: (2025)
par: Guo, Ke, et autres
Publié: (2025)
Documents similaires
-
Finding NeMo: Localizing Neurons Responsible For Memorization in Diffusion Models
par: Hintersdorf, Dominik, et autres
Publié: (2024) -
Training Video Foundation Models with NVIDIA NeMo
par: Patel, Zeeshan, et autres
Publié: (2025) -
NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment
par: Shen, Gerald, et autres
Publié: (2024) -
NeMo: Needle in a Montage for Video-Language Understanding
par: Hu, Zi-Yuan, et autres
Publié: (2025) -
CABS: Conflict-Aware and Balanced Sparsification for Enhancing Model Merging
par: Yang, Zongzhen, et autres
Publié: (2025)