LR-CNN: Lightweight Row-centric Convolutional Neural Network Training for Memory Reduction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhigang, Yang, Hangyu, Wang, Ning, Xu, Chuanfei, Nie, Jie, Wei, Zhiqiang, Gu, Yu, Yu, Ge |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
par: Wang, Kewei, et autres
Publié: (2025)
par: Wang, Kewei, et autres
Publié: (2025)
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
par: Xie, Xi, et autres
Publié: (2024)
par: Xie, Xi, et autres
Publié: (2024)
NeutronTP: Load-Balanced Distributed Full-Graph GNN Training with Tensor Parallelism
par: Ai, Xin, et autres
Publié: (2024)
par: Ai, Xin, et autres
Publié: (2024)
Heta: Distributed Training of Heterogeneous Graph Neural Networks
par: Zhong, Yuchen, et autres
Publié: (2024)
par: Zhong, Yuchen, et autres
Publié: (2024)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
par: Chen, Kefu, et autres
Publié: (2026)
par: Chen, Kefu, et autres
Publié: (2026)
Heterogeneous Federated Learning with Convolutional and Spiking Neural Networks
par: Yu, Yingchao, et autres
Publié: (2024)
par: Yu, Yingchao, et autres
Publié: (2024)
A Lightweight Neural Network for Accelerating Radiative Transfer Modeling in WRF
par: Fredj, Erick, et autres
Publié: (2025)
par: Fredj, Erick, et autres
Publié: (2025)
Distributed Convolutional Neural Network Training on Mobile and Edge Clusters
par: Rama, Pranav, et autres
Publié: (2024)
par: Rama, Pranav, et autres
Publié: (2024)
An Edge-based WiFi Fingerprinting Indoor Localization Using Convolutional Neural Network and Convolutional Auto-Encoder
par: Kargar-Barzi, Amin, et autres
Publié: (2023)
par: Kargar-Barzi, Amin, et autres
Publié: (2023)
mLR: Scalable Laminography Reconstruction based on Memoization
par: Ma, Bin, et autres
Publié: (2025)
par: Ma, Bin, et autres
Publié: (2025)
Chameleon: Taming Dynamic Operator Sequences for Memory-Intensive LLM Training
par: Wang, Zibo, et autres
Publié: (2025)
par: Wang, Zibo, et autres
Publié: (2025)
MalleTrain: Deep Neural Network Training on Unfillable Supercomputer Nodes
par: Ma, Xiaolong, et autres
Publié: (2024)
par: Ma, Xiaolong, et autres
Publié: (2024)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
par: Liu, Lian, et autres
Publié: (2026)
par: Liu, Lian, et autres
Publié: (2026)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
par: Lu, Zhengxian, et autres
Publié: (2024)
par: Lu, Zhengxian, et autres
Publié: (2024)
Malleus: Straggler-Resilient Hybrid Parallel Training of Large-scale Models via Malleable Data and Model Parallelization
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
Optimizing Distributed Training Approaches for Scaling Neural Networks
par: Baligodugula, Vishnu Vardhan, et autres
Publié: (2025)
par: Baligodugula, Vishnu Vardhan, et autres
Publié: (2025)
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
par: Yu, Enda, et autres
Publié: (2024)
par: Yu, Enda, et autres
Publié: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
par: Liang, Antian, et autres
Publié: (2025)
par: Liang, Antian, et autres
Publié: (2025)
Comprehensive Evaluation of GNN Training Systems: A Data Management Perspective
par: Yuan, Hao, et autres
Publié: (2023)
par: Yuan, Hao, et autres
Publié: (2023)
RollMux: Phase-Level Multiplexing for Disaggregated RL Post-Training
par: Wu, Tianyuan, et autres
Publié: (2025)
par: Wu, Tianyuan, et autres
Publié: (2025)
Accelerating Nonlinear Time-History Analysis with Complex Constitutive Laws via Heterogeneous Memory Management: From 3D Seismic Simulation to Neural Network Training
par: Ichimura, Tsuyoshi, et autres
Publié: (2026)
par: Ichimura, Tsuyoshi, et autres
Publié: (2026)
PruneX: A Hierarchical Communication-Efficient System for Distributed CNN Training with Structured Pruning
par: Olama, Alireza, et autres
Publié: (2025)
par: Olama, Alireza, et autres
Publié: (2025)
Armada: Memory-Efficient Distributed Training of Large-Scale Graph Neural Networks
par: Waleffe, Roger, et autres
Publié: (2025)
par: Waleffe, Roger, et autres
Publié: (2025)
Split CNN Inference on Networked Microcontrollers
par: Lu, Junyu, et autres
Publié: (2026)
par: Lu, Junyu, et autres
Publié: (2026)
KunServe: Parameter-centric Memory Management for Efficient Memory Overloading Handling in LLM Serving
par: Cheng, Rongxin, et autres
Publié: (2024)
par: Cheng, Rongxin, et autres
Publié: (2024)
cuConv: A CUDA Implementation of Convolution for CNN Inference
par: Jordà, Marc, et autres
Publié: (2021)
par: Jordà, Marc, et autres
Publié: (2021)
Adaptive Cache Management for Complex Storage Systems Using CNN-LSTM-Based Spatiotemporal Prediction
par: Wang, Xiaoye, et autres
Publié: (2024)
par: Wang, Xiaoye, et autres
Publié: (2024)
Training DNN Models over Heterogeneous Clusters with Optimal Performance
par: Nie, Chengyi, et autres
Publié: (2024)
par: Nie, Chengyi, et autres
Publié: (2024)
Enhancing Memory Efficiency in Large Language Model Training Through Chronos-aware Pipeline Parallelism
par: Lin, Xinyuan, et autres
Publié: (2025)
par: Lin, Xinyuan, et autres
Publié: (2025)
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
par: Niam, Arefin, et autres
Publié: (2025)
par: Niam, Arefin, et autres
Publié: (2025)
A User-centric Kubernetes-based Architecture for Green Cloud Computing
par: Zanotto, Matteo, et autres
Publié: (2025)
par: Zanotto, Matteo, et autres
Publié: (2025)
HybridTier: an Adaptive and Lightweight CXL-Memory Tiering System
par: Song, Kevin, et autres
Publié: (2023)
par: Song, Kevin, et autres
Publié: (2023)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
par: Yu, Minchen, et autres
Publié: (2023)
par: Yu, Minchen, et autres
Publié: (2023)
Data Augmentation and Convolutional Network Architecture Influence on Distributed Learning
par: Jansen, Victor Forattini, et autres
Publié: (2026)
par: Jansen, Victor Forattini, et autres
Publié: (2026)
LLM-CoOpt: A Co-Design and Optimization Framework for Efficient LLM Inference on Heterogeneous Platforms
par: Kong, Jie, et autres
Publié: (2026)
par: Kong, Jie, et autres
Publié: (2026)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
MemFine: Memory-Aware Fine-Grained Scheduling for MoE Training
par: Zhao, Lu, et autres
Publié: (2025)
par: Zhao, Lu, et autres
Publié: (2025)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
par: Li, Aiying, et autres
Publié: (2026)
par: Li, Aiying, et autres
Publié: (2026)
BladeDISC++: Memory Optimizations Based On Symbolic Shape
par: Yuan, Xiulong, et autres
Publié: (2024)
par: Yuan, Xiulong, et autres
Publié: (2024)
Documents similaires
-
Accelerating Heterogeneous Tensor Parallelism via Flexible Workload Control
par: Wang, Zhigang, et autres
Publié: (2024) -
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
par: Wang, Kewei, et autres
Publié: (2025) -
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
par: Xie, Xi, et autres
Publié: (2024) -
NeutronTP: Load-Balanced Distributed Full-Graph GNN Training with Tensor Parallelism
par: Ai, Xin, et autres
Publié: (2024) -
Heta: Distributed Training of Heterogeneous Graph Neural Networks
par: Zhong, Yuchen, et autres
Publié: (2024)