SeWA: Selective Weight Average via Probabilistic Masking
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Peng, Hu, Shengchao, Tao, Zerui, Wang, Guoxia, Yu, Dianhai, Shen, Li, Zheng, Quan, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Unified Analysis for Finite Weight Averaging
por: Wang, Peng, et al.
Publicado: (2024)
por: Wang, Peng, et al.
Publicado: (2024)
Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities
por: Hao, Zhiwei, et al.
Publicado: (2025)
por: Hao, Zhiwei, et al.
Publicado: (2025)
Learning Multi-Agent Communication from Graph Modeling Perspective
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
FlashMask: Efficient and Rich Mask Extension of FlashAttention
por: Wang, Guoxia, et al.
Publicado: (2024)
por: Wang, Guoxia, et al.
Publicado: (2024)
Combatting Dimensional Collapse in LLM Pre-Training Data via Diversified File Selection
por: Fan, Ziqing, et al.
Publicado: (2025)
por: Fan, Ziqing, et al.
Publicado: (2025)
Communication Learning in Multi-Agent Systems from Graph Modeling Perspective
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
por: Hu, Jifeng, et al.
Publicado: (2024)
por: Hu, Jifeng, et al.
Publicado: (2024)
MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs
por: Sun, Yan, et al.
Publicado: (2025)
por: Sun, Yan, et al.
Publicado: (2025)
HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
AdaGC: Improving Training Stability for Large Language Model Pretraining
por: Wang, Guoxia, et al.
Publicado: (2025)
por: Wang, Guoxia, et al.
Publicado: (2025)
Q-value Regularized Transformer for Offline Reinforcement Learning
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Sparse Layer Sharpness-Aware Minimization for Efficient Fine-Tuning
por: Cheng, Yifei, et al.
Publicado: (2026)
por: Cheng, Yifei, et al.
Publicado: (2026)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning
por: Ma, Guozheng, et al.
Publicado: (2025)
por: Ma, Guozheng, et al.
Publicado: (2025)
Continual Task Learning through Adaptive Policy Self-Composition
por: Hu, Shengchao, et al.
Publicado: (2024)
por: Hu, Shengchao, et al.
Publicado: (2024)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
por: Hu, Zixuan, et al.
Publicado: (2025)
por: Hu, Zixuan, et al.
Publicado: (2025)
OLR-WA: Online Weighted Average Linear Regression in Multivariate Data Streams
por: Abu-Shaira, Mohammad, et al.
Publicado: (2025)
por: Abu-Shaira, Mohammad, et al.
Publicado: (2025)
OLC-WA: Drift Aware Tuning-Free Online Classification with Weighted Average
por: Shaira, Mohammad Abu, et al.
Publicado: (2025)
por: Shaira, Mohammad Abu, et al.
Publicado: (2025)
Trainable Weight Averaging: Accelerating Training and Improving Generalization
por: Li, Tao, et al.
Publicado: (2022)
por: Li, Tao, et al.
Publicado: (2022)
A-FedPD: Aligning Dual-Drift is All Federated Primal-Dual Learning Needs
por: Sun, Yan, et al.
Publicado: (2024)
por: Sun, Yan, et al.
Publicado: (2024)
Rethinking the Personalized Relaxed Initialization in the Federated Learning: Consistency and Generalization
por: Shen, Li, et al.
Publicado: (2026)
por: Shen, Li, et al.
Publicado: (2026)
Merging Multi-Task Models via Weight-Ensembling Mixture of Experts
por: Tang, Anke, et al.
Publicado: (2024)
por: Tang, Anke, et al.
Publicado: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
Offline Behavioral Data Selection
por: Lei, Shiye, et al.
Publicado: (2025)
por: Lei, Shiye, et al.
Publicado: (2025)
Task Groupings Regularization: Data-Free Meta-Learning with Heterogeneous Pre-trained Models
por: Wei, Yongxian, et al.
Publicado: (2024)
por: Wei, Yongxian, et al.
Publicado: (2024)
Towards Understanding Generalization and Stability Gaps between Centralized and Decentralized Federated Learning
por: Sun, Yan, et al.
Publicado: (2023)
por: Sun, Yan, et al.
Publicado: (2023)
Mitigating Barren Plateaus in Quantum Denoising Diffusion Probabilistic Model
por: Cao, Haipeng, et al.
Publicado: (2025)
por: Cao, Haipeng, et al.
Publicado: (2025)
Sample Weight Averaging for Stable Prediction
por: Yu, Han, et al.
Publicado: (2025)
por: Yu, Han, et al.
Publicado: (2025)
LLM Data Selection and Utilization via Dynamic Bi-level Optimization
por: Yu, Yang, et al.
Publicado: (2025)
por: Yu, Yang, et al.
Publicado: (2025)
PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation
por: Wu, Wanyin, et al.
Publicado: (2026)
por: Wu, Wanyin, et al.
Publicado: (2026)
Towards Understanding the Generalizability of Delayed Stochastic Gradient Descent
por: Deng, Xiaoge, et al.
Publicado: (2023)
por: Deng, Xiaoge, et al.
Publicado: (2023)
Where to Mask: Structure-Guided Masking for Graph Masked Autoencoders
por: Liu, Chuang, et al.
Publicado: (2024)
por: Liu, Chuang, et al.
Publicado: (2024)
Efficient Nonparametric Tensor Decomposition for Binary and Count Data
por: Tao, Zerui, et al.
Publicado: (2024)
por: Tao, Zerui, et al.
Publicado: (2024)
Scalable Bayesian Tensor Ring Factorization for Multiway Data Analysis
por: Tao, Zerui, et al.
Publicado: (2024)
por: Tao, Zerui, et al.
Publicado: (2024)
Towards Privacy-Preserving and Heterogeneity-aware Split Federated Learning via Probabilistic Masking
por: Wang, Xingchen, et al.
Publicado: (2025)
por: Wang, Xingchen, et al.
Publicado: (2025)
Omni-Masked Gradient Descent: Memory-Efficient Optimization via Mask Traversal with Improved Convergence
por: Yang, Hui, et al.
Publicado: (2026)
por: Yang, Hui, et al.
Publicado: (2026)
Federated Prompt Learning for Weather Foundation Models on Devices
por: Chen, Shengchao, et al.
Publicado: (2023)
por: Chen, Shengchao, et al.
Publicado: (2023)
Efficient Differentiable Causal Discovery via Reliable Super-Structure Learning
por: Ma, Pingchuan, et al.
Publicado: (2026)
por: Ma, Pingchuan, et al.
Publicado: (2026)
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
por: Kong, Yilun, et al.
Publicado: (2025)
por: Kong, Yilun, et al.
Publicado: (2025)
Ejemplares similares
-
A Unified Analysis for Finite Weight Averaging
por: Wang, Peng, et al.
Publicado: (2024) -
Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities
por: Hao, Zhiwei, et al.
Publicado: (2025) -
Learning Multi-Agent Communication from Graph Modeling Perspective
por: Hu, Shengchao, et al.
Publicado: (2024) -
FlashMask: Efficient and Rich Mask Extension of FlashAttention
por: Wang, Guoxia, et al.
Publicado: (2024) -
Combatting Dimensional Collapse in LLM Pre-Training Data via Diversified File Selection
por: Fan, Ziqing, et al.
Publicado: (2025)