Adaptive Pruning of Pretrained Transformer via Differential Inclusions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Yizhuo, Fan, Ke, Wang, Yikai, Sun, Xinwei, Fu, Yanwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs
par: Ding, Yizhuo, et autres
Publié: (2025)
par: Ding, Yizhuo, et autres
Publié: (2025)
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
par: Ding, Yizhuo, et autres
Publié: (2025)
par: Ding, Yizhuo, et autres
Publié: (2025)
NeuroPictor: Refining fMRI-to-Image Reconstruction via Multi-individual Pretraining and Multi-level Modulation
par: Huo, Jingyang, et autres
Publié: (2024)
par: Huo, Jingyang, et autres
Publié: (2024)
Doubly Robust Proximal Causal Learning for Continuous Treatments
par: Wu, Yong, et autres
Publié: (2023)
par: Wu, Yong, et autres
Publié: (2023)
Magnitude Pruning of Large Pretrained Transformer Models with a Mixture Gaussian Prior
par: Zhang, Mingxuan, et autres
Publié: (2024)
par: Zhang, Mingxuan, et autres
Publié: (2024)
Robust Network Learning via Inverse Scale Variational Sparsification
par: Zhou, Zhiling, et autres
Publié: (2024)
par: Zhou, Zhiling, et autres
Publié: (2024)
A New Formulation of Lipschitz Constrained With Functional Gradient Learning for GANs
par: Wan, Chang, et autres
Publié: (2025)
par: Wan, Chang, et autres
Publié: (2025)
Discovering Causal Relationships using Proxy Variables under Unmeasured Confounding
par: Wu, Yong, et autres
Publié: (2025)
par: Wu, Yong, et autres
Publié: (2025)
Understanding Differential Transformer Unchains Pretrained Self-Attentions
par: Kong, Chaerin, et autres
Publié: (2025)
par: Kong, Chaerin, et autres
Publié: (2025)
ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning
par: Zhang, Jinyang, et autres
Publié: (2025)
par: Zhang, Jinyang, et autres
Publié: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
COSMO-RL: Towards Trustworthy LMRMs via Joint Safety and Stability
par: Ding, Yizhuo, et autres
Publié: (2025)
par: Ding, Yizhuo, et autres
Publié: (2025)
Adaptive Computation Pruning for the Forgetting Transformer
par: Lin, Zhixuan, et autres
Publié: (2025)
par: Lin, Zhixuan, et autres
Publié: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
par: Li, Yixiao, et autres
Publié: (2025)
par: Li, Yixiao, et autres
Publié: (2025)
Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling
par: Grangier, David, et autres
Publié: (2024)
par: Grangier, David, et autres
Publié: (2024)
Projection-Free CNN Pruning via Frank-Wolfe with Momentum: Sparser Models with Less Pretraining
par: Shili, Hamza ElMokhtar, et autres
Publié: (2025)
par: Shili, Hamza ElMokhtar, et autres
Publié: (2025)
SequentialAttention++ for Block Sparsification: Differentiable Pruning Meets Combinatorial Optimization
par: Yasuda, Taisuke, et autres
Publié: (2024)
par: Yasuda, Taisuke, et autres
Publié: (2024)
Adaptive Slot Attention: Object Discovery with Dynamic Slot Number
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
Fast Track to Winning Tickets: Repowering One-Shot Pruning for Graph Neural Networks
par: Yue, Yanwei, et autres
Publié: (2024)
par: Yue, Yanwei, et autres
Publié: (2024)
Dataset Condensation for Time Series Classification via Dual Domain Matching
par: Liu, Zhanyu, et autres
Publié: (2024)
par: Liu, Zhanyu, et autres
Publié: (2024)
Demystifying When Pruning Works via Representation Hierarchies
par: He, Shwai, et autres
Publié: (2026)
par: He, Shwai, et autres
Publié: (2026)
Spiking Layer-Adaptive Magnitude-based Pruning
par: Wang, Junqiao, et autres
Publié: (2026)
par: Wang, Junqiao, et autres
Publié: (2026)
Variational Routing: A Scalable Bayesian Framework for Calibrated Mixture-of-Experts Transformers
par: Li, Albus Yizhuo, et autres
Publié: (2026)
par: Li, Albus Yizhuo, et autres
Publié: (2026)
ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
par: Liu, Lawrence, et autres
Publié: (2025)
par: Liu, Lawrence, et autres
Publié: (2025)
TapWeight: Reweighting Pretraining Objectives for Task-Adaptive Pretraining
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining
par: Fan, Simin, et autres
Publié: (2025)
par: Fan, Simin, et autres
Publié: (2025)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
par: Wang, Zhibo, et autres
Publié: (2026)
par: Wang, Zhibo, et autres
Publié: (2026)
Non-transferable Pruning
par: Ding, Ruyi, et autres
Publié: (2024)
par: Ding, Ruyi, et autres
Publié: (2024)
Distributional Reinforcement Learning with Diffusion Bridge Critics
par: Ding, Shutong, et autres
Publié: (2026)
par: Ding, Shutong, et autres
Publié: (2026)
Pruning and Malicious Injection: A Retraining-Free Backdoor Attack on Transformer Models
par: Zhao, Taibiao, et autres
Publié: (2025)
par: Zhao, Taibiao, et autres
Publié: (2025)
Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum
par: Li, Jingru, et autres
Publié: (2026)
par: Li, Jingru, et autres
Publié: (2026)
Heterogeneous Graph Prompt Learning via Adaptive Weight Pruning
par: Wei, Chu-Yuan, et autres
Publié: (2025)
par: Wei, Chu-Yuan, et autres
Publié: (2025)
Unified Lexical Representation for Interpretable Visual-Language Alignment
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
MaSS: Multi-attribute Selective Suppression for Utility-preserving Data Transformation from an Information-theoretic Perspective
par: Chen, Yizhuo, et autres
Publié: (2024)
par: Chen, Yizhuo, et autres
Publié: (2024)
Self-supervised Pretraining for Partial Differential Equations
par: Madhavan, Varun, et autres
Publié: (2024)
par: Madhavan, Varun, et autres
Publié: (2024)
SAP: Syntactic Attention Pruning for Transformer-based Language Models
par: Lee, Tzu-Yun, et autres
Publié: (2025)
par: Lee, Tzu-Yun, et autres
Publié: (2025)
EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models
par: Xing, Xingrun, et autres
Publié: (2025)
par: Xing, Xingrun, et autres
Publié: (2025)
Causal Discovery via Conditional Independence Testing with Proxy Variables
par: Liu, Mingzhou, et autres
Publié: (2023)
par: Liu, Mingzhou, et autres
Publié: (2023)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
par: Le, Qi, et autres
Publié: (2025)
par: Le, Qi, et autres
Publié: (2025)
Improving DNS Exfiltration Detection via Transformer Pretraining
par: Tomić, Miloš, et autres
Publié: (2026)
par: Tomić, Miloš, et autres
Publié: (2026)
Documents similaires
-
UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs
par: Ding, Yizhuo, et autres
Publié: (2025) -
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
par: Ding, Yizhuo, et autres
Publié: (2025) -
NeuroPictor: Refining fMRI-to-Image Reconstruction via Multi-individual Pretraining and Multi-level Modulation
par: Huo, Jingyang, et autres
Publié: (2024) -
Doubly Robust Proximal Causal Learning for Continuous Treatments
par: Wu, Yong, et autres
Publié: (2023) -
Magnitude Pruning of Large Pretrained Transformer Models with a Mixture Gaussian Prior
par: Zhang, Mingxuan, et autres
Publié: (2024)