Communication-Efficient, 2D Parallel Stochastic Gradient Descent for Distributed-Memory Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Devarakonda, Aditya, Kannan, Ramakrishnan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dynamic Memory Management on GPUs with SYCL
par: Standish, Russell K.
Publié: (2025)
par: Standish, Russell K.
Publié: (2025)
Efficient Parallel Scheduling for Sparse Triangular Solvers
par: Böhnlein, Toni, et autres
Publié: (2025)
par: Böhnlein, Toni, et autres
Publié: (2025)
A Systematic Literature Survey of Sparse Matrix-Vector Multiplication
par: Gao, Jianhua, et autres
Publié: (2024)
par: Gao, Jianhua, et autres
Publié: (2024)
Scalable Dual Coordinate Descent for Kernel Methods
par: Shao, Zishan, et autres
Publié: (2024)
par: Shao, Zishan, et autres
Publié: (2024)
Parallel Self-Avoiding Walks for a Low-Autocorrelation Binary Sequences Problem
par: Bošković, Borko, et autres
Publié: (2022)
par: Bošković, Borko, et autres
Publié: (2022)
Solving Large Rank-Deficient Linear Least-Squares Problems on Shared-Memory CPU Architectures and GPU Architectures
par: Chillarón, Mónica, et autres
Publié: (2024)
par: Chillarón, Mónica, et autres
Publié: (2024)
Precision-Aware Iterative Algorithms Based on Group-Shared Exponents of Floating-Point Numbers
par: Gao, Jianhua, et autres
Publié: (2024)
par: Gao, Jianhua, et autres
Publié: (2024)
Cascaded Prediction and Asynchronous Execution of Iterative Algorithms on Heterogeneous Platforms
par: Gao, Jianhua, et autres
Publié: (2024)
par: Gao, Jianhua, et autres
Publié: (2024)
Scalable Domain-decomposed Monte Carlo Neutral Transport for Nuclear Fusion
par: Lappi, Oskar, et autres
Publié: (2025)
par: Lappi, Oskar, et autres
Publié: (2025)
Efficiently Scheduling Parallel DAG Tasks on Identical Multiprocessors
par: Lendve, Shardul, et autres
Publié: (2024)
par: Lendve, Shardul, et autres
Publié: (2024)
FlashSpread: IO-Aware GPU Simulation of Non-Markovian Epidemic Dynamics via Kernel Fusion
par: Shakeri, Heman, et autres
Publié: (2026)
par: Shakeri, Heman, et autres
Publié: (2026)
Leveraging Multi-Instance GPUs through moldable task scheduling
par: Villarrubia, Jorge, et autres
Publié: (2025)
par: Villarrubia, Jorge, et autres
Publié: (2025)
cuGenOpt: A GPU-Accelerated General-Purpose Metaheuristic Framework for Combinatorial Optimization
par: Liu, Yuyang
Publié: (2026)
par: Liu, Yuyang
Publié: (2026)
Design, Configuration, Implementation, and Performance of a Simple 32 Core Raspberry Pi Cluster
par: Cicirello, Vincent A.
Publié: (2017)
par: Cicirello, Vincent A.
Publié: (2017)
Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach
par: Xiaoteng, et autres
Publié: (2024)
par: Xiaoteng, et autres
Publié: (2024)
Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation
par: Cheng, Long, et autres
Publié: (2026)
par: Cheng, Long, et autres
Publié: (2026)
Optimizing Fine-Grained Parallelism Through Dynamic Load Balancing on Multi-Socket Many-Core Systems
par: Wang, Wenyi, et autres
Publié: (2025)
par: Wang, Wenyi, et autres
Publié: (2025)
A Simple Communication Scheme for Distributed Fast Multipole Methods
par: Kailasa, Srinath
Publié: (2026)
par: Kailasa, Srinath
Publié: (2026)
Decentralized Optimization in Time-Varying Networks with Arbitrary Delays
par: Ortega, Tomas, et autres
Publié: (2024)
par: Ortega, Tomas, et autres
Publié: (2024)
Optimizing Multi-DNN Inference on Mobile Devices through Heterogeneous Processor Co-Execution
par: Gao, Yunquan, et autres
Publié: (2025)
par: Gao, Yunquan, et autres
Publié: (2025)
An Empirical Evaluation of Quantum-Inspired QUBO Methods for Heterogeneous HPC Workflow Mapping and Scheduling
par: Sharma, Aasish Kumar, et autres
Publié: (2026)
par: Sharma, Aasish Kumar, et autres
Publié: (2026)
OPTIMUM-DERAM: Highly Consistent, Scalable, and Secure Multi-Object Memory using RLNC
par: Nicolaou, Nicolas, et autres
Publié: (2026)
par: Nicolaou, Nicolas, et autres
Publié: (2026)
PackSELL: A Sparse Matrix Format for Precision-Agnostic High-Performance SpMV
par: Suzuki, Kengo, et autres
Publié: (2026)
par: Suzuki, Kengo, et autres
Publié: (2026)
A Lock-Free, Fully GPU-Resident Architecture for the Verification of Goldbach's Conjecture
par: Llorente-Saguer, Isaac
Publié: (2026)
par: Llorente-Saguer, Isaac
Publié: (2026)
Algorithms for Parallel Shared-Memory Sparse Matrix-Vector Multiplication on Unstructured Matrices
par: Bergmans, Kobe, et autres
Publié: (2025)
par: Bergmans, Kobe, et autres
Publié: (2025)
Utilizing Sparsity in the GPU-accelerated Assembly of Schur Complement Matrices in Domain Decomposition Methods
par: Homola, Jakub, et autres
Publié: (2025)
par: Homola, Jakub, et autres
Publié: (2025)
Reinforcement Learning Controlled Adaptive PSO for Task Offloading in IIoT Edge Computing
par: Perera, Minod, et autres
Publié: (2025)
par: Perera, Minod, et autres
Publié: (2025)
Decentralized Stochastic Optimization over Unreliable Networks via Two-timescales Updates
par: Liu, Haoming, et autres
Publié: (2025)
par: Liu, Haoming, et autres
Publié: (2025)
Accelerating Matrix Multiplication: A Performance Comparison Between Multi-Core CPU and GPU
par: Ansari, Mufakir Qamar, et autres
Publié: (2025)
par: Ansari, Mufakir Qamar, et autres
Publié: (2025)
Population Protocols Revisited: Parity and Beyond
par: Gąsieniec, Leszek, et autres
Publié: (2025)
par: Gąsieniec, Leszek, et autres
Publié: (2025)
Distributed and heterogeneous tensor-vector contraction algorithms for high performance computing
par: Martinez-Ferrer, Pedro J., et autres
Publié: (2025)
par: Martinez-Ferrer, Pedro J., et autres
Publié: (2025)
Gradient Coding with Iterative Block Leverage Score Sampling
par: Charalambides, Neophytos, et autres
Publié: (2023)
par: Charalambides, Neophytos, et autres
Publié: (2023)
AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs
par: Li, Chendi, et autres
Publié: (2022)
par: Li, Chendi, et autres
Publié: (2022)
Enabling Practical Transparent Checkpointing for MPI: A Topological Sort Approach
par: Xu, Yao, et autres
Publié: (2024)
par: Xu, Yao, et autres
Publié: (2024)
NM-SpMM: Accelerating Matrix Multiplication Using N:M Sparsity with GPGPU
par: Ma, Cong, et autres
Publié: (2025)
par: Ma, Cong, et autres
Publié: (2025)
Static Batching of Irregular Workloads on GPUs: Framework and Application to Efficient MoE Model Inference
par: Li, Yinghan, et autres
Publié: (2025)
par: Li, Yinghan, et autres
Publié: (2025)
Racing to Idle: Energy Efficiency of Matrix Multiplication on Heterogeneous CPU and GPU Architectures
par: Ansari, Mufakir Qamar, et autres
Publié: (2025)
par: Ansari, Mufakir Qamar, et autres
Publié: (2025)
GPU acceleration of non-equilibrium Green's function calculation using OpenACC and CUDA FORTRAN
par: Yin, Jia, et autres
Publié: (2025)
par: Yin, Jia, et autres
Publié: (2025)
Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
par: Zhao, Haisha, et autres
Publié: (2025)
par: Zhao, Haisha, et autres
Publié: (2025)
Context Adaptive Cooperation
par: Albouy, Timothé, et autres
Publié: (2023)
par: Albouy, Timothé, et autres
Publié: (2023)
Documents similaires
-
Dynamic Memory Management on GPUs with SYCL
par: Standish, Russell K.
Publié: (2025) -
Efficient Parallel Scheduling for Sparse Triangular Solvers
par: Böhnlein, Toni, et autres
Publié: (2025) -
A Systematic Literature Survey of Sparse Matrix-Vector Multiplication
par: Gao, Jianhua, et autres
Publié: (2024) -
Scalable Dual Coordinate Descent for Kernel Methods
par: Shao, Zishan, et autres
Publié: (2024) -
Parallel Self-Avoiding Walks for a Low-Autocorrelation Binary Sequences Problem
par: Bošković, Borko, et autres
Publié: (2022)