Model Parallelism With Subnetwork Data Parallelism
Fuente:
arXiv
Salvato in:
| Autori principali: | Singh, Vaibhav, Khalid, Zafir, Cagnasso, Pietro, Oyallon, Edouard, Belilovsky, Eugene |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cyclic Data Parallelism for Efficient Parallelism of Deep Neural Networks
di: Fournier, Louis, et al.
Pubblicazione: (2024)
di: Fournier, Louis, et al.
Pubblicazione: (2024)
ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training
di: Nabli, Adel, et al.
Pubblicazione: (2024)
di: Nabli, Adel, et al.
Pubblicazione: (2024)
PETRA: Parallel End-to-end Training with Reversible Architectures
di: Rivaud, Stéphane, et al.
Pubblicazione: (2024)
di: Rivaud, Stéphane, et al.
Pubblicazione: (2024)
Stabilizing Native Low-Rank LLM Pretraining
di: Janson, Paul, et al.
Pubblicazione: (2026)
di: Janson, Paul, et al.
Pubblicazione: (2026)
DISCO: learning to DISCover an evolution Operator for multi-physics-agnostic prediction
di: Morel, Rudy, et al.
Pubblicazione: (2025)
di: Morel, Rudy, et al.
Pubblicazione: (2025)
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
Warming Up for Zeroth-Order Federated Pre-Training with Low Resource Clients
di: Legate, Gwen, et al.
Pubblicazione: (2025)
di: Legate, Gwen, et al.
Pubblicazione: (2025)
Celo2: Towards Learned Optimization Free Lunch
di: Moudgil, Abhinav, et al.
Pubblicazione: (2026)
di: Moudgil, Abhinav, et al.
Pubblicazione: (2026)
Efficient Refusal Ablation in LLM through Optimal Transport
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)
When Data Falls Short: Grokking Below the Critical Threshold
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
Not Only the Last-Layer Features for Spurious Correlations: All Layer Deep Feature Reweighting
di: Hameed, Humza Wajid, et al.
Pubblicazione: (2024)
di: Hameed, Humza Wajid, et al.
Pubblicazione: (2024)
Less is More: Undertraining Experts Improves Model Upcycling
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
Non-Uniform Parameter-Wise Model Merging
di: Camacho, Albert Manuel Orozco, et al.
Pubblicazione: (2024)
di: Camacho, Albert Manuel Orozco, et al.
Pubblicazione: (2024)
On Non-Linear operators for Geometric Deep Learning
di: Sergeant-Perthuis, Grégoire, et al.
Pubblicazione: (2022)
di: Sergeant-Perthuis, Grégoire, et al.
Pubblicazione: (2022)
Dual-Phase Continual Learning: Supervised Adaptation Meets Unsupervised Retention
di: Singh, Vaibhav, et al.
Pubblicazione: (2024)
di: Singh, Vaibhav, et al.
Pubblicazione: (2024)
$μ$LO: Compute-Efficient Meta-Generalization of Learned Optimizers
di: Thérien, Benjamin, et al.
Pubblicazione: (2024)
di: Thérien, Benjamin, et al.
Pubblicazione: (2024)
Instilling Inductive Biases with Subnetworks
di: Zhang, Enyan, et al.
Pubblicazione: (2023)
di: Zhang, Enyan, et al.
Pubblicazione: (2023)
Scaling Up Data Parallelism in Decentralized Deep Learning
di: Xie, Bing, et al.
Pubblicazione: (2025)
di: Xie, Bing, et al.
Pubblicazione: (2025)
Accelerating Training with Neuron Interaction and Nowcasting Networks
di: Knyazev, Boris, et al.
Pubblicazione: (2024)
di: Knyazev, Boris, et al.
Pubblicazione: (2024)
WASH: Train your Ensemble with Communication-Efficient Weight Shuffling, then Average
di: Fournier, Louis, et al.
Pubblicazione: (2024)
di: Fournier, Louis, et al.
Pubblicazione: (2024)
Implicit Language Models are RNNs: Balancing Parallelization and Expressivity
di: Schöne, Mark, et al.
Pubblicazione: (2025)
di: Schöne, Mark, et al.
Pubblicazione: (2025)
The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks
di: Mayor, Walter, et al.
Pubblicazione: (2025)
di: Mayor, Walter, et al.
Pubblicazione: (2025)
Reinforcement Learning Fine-Tunes a Sparse Subnetwork in Large Language Models
di: Balashov, Andrii
Pubblicazione: (2025)
di: Balashov, Andrii
Pubblicazione: (2025)
Memory Constrained Dynamic Subnetwork Update for Transfer Learning
di: Quélennec, Aël, et al.
Pubblicazione: (2025)
di: Quélennec, Aël, et al.
Pubblicazione: (2025)
SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models
di: Biju, Emil, et al.
Pubblicazione: (2025)
di: Biju, Emil, et al.
Pubblicazione: (2025)
Diffusion Models are Secretly Exchangeable: Parallelizing DDPMs via Autospeculation
di: Hu, Hengyuan, et al.
Pubblicazione: (2025)
di: Hu, Hengyuan, et al.
Pubblicazione: (2025)
Improving Token-Based World Models with Parallel Observation Prediction
di: Cohen, Lior, et al.
Pubblicazione: (2024)
di: Cohen, Lior, et al.
Pubblicazione: (2024)
Generalized Parallel Scaling with Interdependent Generations
di: Dong, Harry, et al.
Pubblicazione: (2025)
di: Dong, Harry, et al.
Pubblicazione: (2025)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
Routing the Lottery: Adaptive Subnetworks for Heterogeneous Data
di: Stefanski, Grzegorz, et al.
Pubblicazione: (2026)
di: Stefanski, Grzegorz, et al.
Pubblicazione: (2026)
An LLM-Tool Compiler for Fused Parallel Function Calling
di: Singh, Simranjit, et al.
Pubblicazione: (2024)
di: Singh, Simranjit, et al.
Pubblicazione: (2024)
A Combinatorial Theory of Dropout: Subnetworks, Graph Geometry, and Generalization
di: Dhayalkar, Sahil Rajesh
Pubblicazione: (2025)
di: Dhayalkar, Sahil Rajesh
Pubblicazione: (2025)
FedSI: Federated Subnetwork Inference for Efficient Uncertainty Quantification
di: Chen, Hui, et al.
Pubblicazione: (2024)
di: Chen, Hui, et al.
Pubblicazione: (2024)
The Multiple Ticket Hypothesis: Random Sparse Subnetworks Suffice for RLVR
di: Adewuyi, Israel, et al.
Pubblicazione: (2026)
di: Adewuyi, Israel, et al.
Pubblicazione: (2026)
From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
di: Fu, Hengyu, et al.
Pubblicazione: (2025)
di: Fu, Hengyu, et al.
Pubblicazione: (2025)
Energy Consumption in Parallel Neural Network Training
di: Huber, Philipp, et al.
Pubblicazione: (2025)
di: Huber, Philipp, et al.
Pubblicazione: (2025)
DMax: Aggressive Parallel Decoding for dLLMs
di: Chen, Zigeng, et al.
Pubblicazione: (2026)
di: Chen, Zigeng, et al.
Pubblicazione: (2026)
PRISM: Parallel Reward Integration with Symmetry for MORL
di: van der Knaap, Finn, et al.
Pubblicazione: (2026)
di: van der Knaap, Finn, et al.
Pubblicazione: (2026)
Silent Inconsistency in Data-Parallel Full Fine-Tuning: Diagnosing Worker-Level Optimization Misalignment
di: Li, Hong, et al.
Pubblicazione: (2026)
di: Li, Hong, et al.
Pubblicazione: (2026)
Parallel Structures in Pre-training Data Yield In-Context Learning
di: Chen, Yanda, et al.
Pubblicazione: (2024)
di: Chen, Yanda, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cyclic Data Parallelism for Efficient Parallelism of Deep Neural Networks
di: Fournier, Louis, et al.
Pubblicazione: (2024) -
ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training
di: Nabli, Adel, et al.
Pubblicazione: (2024) -
PETRA: Parallel End-to-end Training with Reversible Architectures
di: Rivaud, Stéphane, et al.
Pubblicazione: (2024) -
Stabilizing Native Low-Rank LLM Pretraining
di: Janson, Paul, et al.
Pubblicazione: (2026) -
DISCO: learning to DISCover an evolution Operator for multi-physics-agnostic prediction
di: Morel, Rudy, et al.
Pubblicazione: (2025)