Learning Scalable Model Soup on a Single GPU: An Efficient Subspace Training Strategy
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Tao, Jiang, Weisen, Liu, Fanghui, Huang, Xiaolin, Kwok, James T. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Effective Structured Prompting by Meta-Learning and Representative Verbalizer
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
von: Chen, Shuhao, et al.
Veröffentlicht: (2024)
von: Chen, Shuhao, et al.
Veröffentlicht: (2024)
End-to-end Kernel Learning via Generative Random Fourier Features
von: Fang, Kun, et al.
Veröffentlicht: (2020)
von: Fang, Kun, et al.
Veröffentlicht: (2020)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
BYOM: Building Your Own Multi-Task Model For Free
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)
Local Superior Soups: A Catalyst for Model Merging in Cross-Silo Federated Learning
von: Chen, Minghui, et al.
Veröffentlicht: (2024)
von: Chen, Minghui, et al.
Veröffentlicht: (2024)
Self-Soupervision: Cooking Model Soups without Labels
von: Fuller, Anthony, et al.
Veröffentlicht: (2026)
von: Fuller, Anthony, et al.
Veröffentlicht: (2026)
Efficient Pareto Manifold Learning with Low-Rank Structure
von: Chen, Weiyu, et al.
Veröffentlicht: (2024)
von: Chen, Weiyu, et al.
Veröffentlicht: (2024)
SubTrack++ : Gradient Subspace Tracking for Scalable LLM Training
von: Rajabi, Sahar, et al.
Veröffentlicht: (2025)
von: Rajabi, Sahar, et al.
Veröffentlicht: (2025)
OASIS: Online Activation Subspace Learning for Memory-Efficient Training
von: Choudhary, Sakshi, et al.
Veröffentlicht: (2026)
von: Choudhary, Sakshi, et al.
Veröffentlicht: (2026)
RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation
von: Chen, Shuhao, et al.
Veröffentlicht: (2026)
von: Chen, Shuhao, et al.
Veröffentlicht: (2026)
Enhancing Sharpness-Aware Minimization by Learning Perturbation Radius
von: Wang, Xuehao, et al.
Veröffentlicht: (2024)
von: Wang, Xuehao, et al.
Veröffentlicht: (2024)
Randomized Gradient Subspaces for Efficient Large Language Model Training
von: Rajabi, Sahar, et al.
Veröffentlicht: (2025)
von: Rajabi, Sahar, et al.
Veröffentlicht: (2025)
Dual-Balancing for Multi-Task Learning
von: Lin, Baijiong, et al.
Veröffentlicht: (2023)
von: Lin, Baijiong, et al.
Veröffentlicht: (2023)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
LoRA-One: One-Step Full Gradient Could Suffice for Fine-Tuning Large Language Models, Provably and Efficiently
von: Zhang, Yuanhe, et al.
Veröffentlicht: (2025)
von: Zhang, Yuanhe, et al.
Veröffentlicht: (2025)
A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2025)
von: Chen, Yiming, et al.
Veröffentlicht: (2025)
LT-Soups: Bridging Head and Tail Classes via Subsampled Model Soups
von: Aminbeidokhti, Masih, et al.
Veröffentlicht: (2025)
von: Aminbeidokhti, Masih, et al.
Veröffentlicht: (2025)
Learning with Norm Constrained, Over-parameterized, Two-layer Neural Networks
von: Liu, Fanghui, et al.
Veröffentlicht: (2024)
von: Liu, Fanghui, et al.
Veröffentlicht: (2024)
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
von: Chen, Shuhao, et al.
Veröffentlicht: (2026)
von: Chen, Shuhao, et al.
Veröffentlicht: (2026)
Memory-Efficient LLM Training with Online Subspace Descent
von: Liang, Kaizhao, et al.
Veröffentlicht: (2024)
von: Liang, Kaizhao, et al.
Veröffentlicht: (2024)
Scalable Hyperparameter-Divergent Ensemble Training with Automatic Learning Rate Exploration for Large Models
von: Cheng, Hailing, et al.
Veröffentlicht: (2026)
von: Cheng, Hailing, et al.
Veröffentlicht: (2026)
PRAC: Principal-Random Subspace for LLM Activation Compression and Memory-Efficient Training
von: Li, Yanyi, et al.
Veröffentlicht: (2026)
von: Li, Yanyi, et al.
Veröffentlicht: (2026)
Subspace Optimization for Efficient Federated Learning under Heterogeneous Data
von: Zhu, Shuchen, et al.
Veröffentlicht: (2026)
von: Zhu, Shuchen, et al.
Veröffentlicht: (2026)
SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF
von: Chegini, Atoosa, et al.
Veröffentlicht: (2024)
von: Chegini, Atoosa, et al.
Veröffentlicht: (2024)
Trainable Weight Averaging: Accelerating Training and Improving Generalization
von: Li, Tao, et al.
Veröffentlicht: (2022)
von: Li, Tao, et al.
Veröffentlicht: (2022)
Efficient Resource-Constrained Training of Transformers via Subspace Optimization
von: Nguyen, Le-Trung, et al.
Veröffentlicht: (2025)
von: Nguyen, Le-Trung, et al.
Veröffentlicht: (2025)
Self-Regularized Learning Methods
von: Schölpple, Max, et al.
Veröffentlicht: (2026)
von: Schölpple, Max, et al.
Veröffentlicht: (2026)
A Novel Spatiotemporal Coupling Graph Convolutional Network
von: Bi, Fanghui
Veröffentlicht: (2024)
von: Bi, Fanghui
Veröffentlicht: (2024)
Enhanced Soups for Graph Neural Networks
von: Zuber, Joseph, et al.
Veröffentlicht: (2025)
von: Zuber, Joseph, et al.
Veröffentlicht: (2025)
Bone Soups: A Seek-and-Soup Model Merging Approach for Controllable Multi-Objective Generation
von: Xie, Guofu, et al.
Veröffentlicht: (2025)
von: Xie, Guofu, et al.
Veröffentlicht: (2025)
NGDB-Zoo: Towards Efficient and Scalable Neural Graph Databases Training
von: Xie, Zhongwei, et al.
Veröffentlicht: (2026)
von: Xie, Zhongwei, et al.
Veröffentlicht: (2026)
Spectral Souping: A Unified Framework for Online Preference Alignment
von: Chow, Yinlam, et al.
Veröffentlicht: (2026)
von: Chow, Yinlam, et al.
Veröffentlicht: (2026)
Improving Robustness of Foundation Models in Domain Adaptation with Soup-Adapters
von: Roschkowski, Marco
Veröffentlicht: (2025)
von: Roschkowski, Marco
Veröffentlicht: (2025)
Fast and Scalable Semi-Supervised Learning for Multi-View Subspace Clustering
von: Ling, Huaming, et al.
Veröffentlicht: (2024)
von: Ling, Huaming, et al.
Veröffentlicht: (2024)
State Soup: In-Context Skill Learning, Retrieval and Mixing
von: Pióro, Maciej, et al.
Veröffentlicht: (2024)
von: Pióro, Maciej, et al.
Veröffentlicht: (2024)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
von: Jiang, Weisen, et al.
Veröffentlicht: (2025)
von: Jiang, Weisen, et al.
Veröffentlicht: (2025)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
von: Zheng, Rui, et al.
Veröffentlicht: (2024)
von: Zheng, Rui, et al.
Veröffentlicht: (2024)
RADIN: Souping on a Budget
von: Menes, Thibaut, et al.
Veröffentlicht: (2024)
von: Menes, Thibaut, et al.
Veröffentlicht: (2024)
A Survey on Time-Series Pre-Trained Models
von: Ma, Qianli, et al.
Veröffentlicht: (2023)
von: Ma, Qianli, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Effective Structured Prompting by Meta-Learning and Representative Verbalizer
von: Jiang, Weisen, et al.
Veröffentlicht: (2023) -
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
von: Chen, Shuhao, et al.
Veröffentlicht: (2024) -
End-to-end Kernel Learning via Generative Random Fourier Features
von: Fang, Kun, et al.
Veröffentlicht: (2020) -
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
von: Jiang, Weisen, et al.
Veröffentlicht: (2023) -
BYOM: Building Your Own Multi-Task Model For Free
von: Jiang, Weisen, et al.
Veröffentlicht: (2023)