FCDP: Fully Cached Data Parallel for Communication-Avoiding Large-Scale Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Park, Gyeongseo, Lee, Eungyeong, Sok, Song-woo, Cha, Myung-Hoon, Koh, Kwangwon, An, Baik-Song, Kim, Hongyeon, Kang, Ki-Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dodoor: Efficient Randomized Decentralized Scheduling with Load Caching for Heterogeneous Tasks and Clusters
par: Da, Wei, et autres
Publié: (2025)
par: Da, Wei, et autres
Publié: (2025)
NotebookOS: A Replicated Notebook Platform for Interactive Training with On-Demand GPUs
par: Carver, Benjamin, et autres
Publié: (2025)
par: Carver, Benjamin, et autres
Publié: (2025)
Limitless FaaS: Overcoming serverless functions execution time limits with invoke driven architecture and memory checkpoints
par: Andraca, Rodrigo Landa, et autres
Publié: (2024)
par: Andraca, Rodrigo Landa, et autres
Publié: (2024)
Efficient and Reuseable Cloud Configuration Search Using Discovery Spaces
par: Johnston, Michael, et autres
Publié: (2025)
par: Johnston, Michael, et autres
Publié: (2025)
Cloud Uptime Archive: Open-Access Availability Data of Web, Cloud, and Gaming Services
par: Talluri, Sacheendra, et autres
Publié: (2025)
par: Talluri, Sacheendra, et autres
Publié: (2025)
Scalability Evaluation of HPC Multi-GPU Training for ECG-based LLMs
par: Mileski, Dimitar, et autres
Publié: (2025)
par: Mileski, Dimitar, et autres
Publié: (2025)
eScope: A Fine-Grained Power Prediction Mechanism for Mobile Applications
par: Mukherjee, Dipayan, et autres
Publié: (2024)
par: Mukherjee, Dipayan, et autres
Publié: (2024)
SkyNomad: On Using Multi-Region Spot Instances to Minimize AI Batch Job Cost
par: Li, Zhifei, et autres
Publié: (2026)
par: Li, Zhifei, et autres
Publié: (2026)
FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines
par: He, Jiaao, et autres
Publié: (2024)
par: He, Jiaao, et autres
Publié: (2024)
Distributed Recoverable Sketches (Extended Version)
par: Cohen, Diana, et autres
Publié: (2025)
par: Cohen, Diana, et autres
Publié: (2025)
Intersections of Web3 and AI -- View in 2024
par: Hyland-Wood, David, et autres
Publié: (2024)
par: Hyland-Wood, David, et autres
Publié: (2024)
Artifact Evaluation for Distributed Systems: Current Practices and Beyond
par: Sedghpour, Mohammad Reza Saleh, et autres
Publié: (2024)
par: Sedghpour, Mohammad Reza Saleh, et autres
Publié: (2024)
Comprehensive Plugin-Based Monitoring of Nexflow Workflow Executions
par: Kharma, Sami, et autres
Publié: (2026)
par: Kharma, Sami, et autres
Publié: (2026)
Using a Market Economy to Provision Compute Resources Across Planet-wide Clusters
par: Stokely, Murray, et autres
Publié: (2025)
par: Stokely, Murray, et autres
Publié: (2025)
Generic Multicast (Extended Version)
par: Bolina, José Augusto, et autres
Publié: (2024)
par: Bolina, José Augusto, et autres
Publié: (2024)
Parallel/Distributed Tabu Search for Scheduling Microprocessor Tasks in Hybrid Flowshop
par: Janiak, Adam, et autres
Publié: (2025)
par: Janiak, Adam, et autres
Publié: (2025)
OPTIMUMP2P: Fast and Reliable Gossiping in P2P Networks
par: Nicolaou, Nicolas, et autres
Publié: (2025)
par: Nicolaou, Nicolas, et autres
Publié: (2025)
A Treasure Trove of Performance: Analyzing the IO500 Submission Data
par: Kunkel, Julian, et autres
Publié: (2026)
par: Kunkel, Julian, et autres
Publié: (2026)
NimbusGuard: A Novel Framework for Proactive Kubernetes Autoscaling Using Deep Q-Networks
par: Wanigasooriya, Chamath, et autres
Publié: (2026)
par: Wanigasooriya, Chamath, et autres
Publié: (2026)
Lincoln AI Computing Survey (LAICS) and Trends
par: Reuther, Albert, et autres
Publié: (2025)
par: Reuther, Albert, et autres
Publié: (2025)
Toward a Universal GPU Instruction Set Architecture: A Cross-Vendor Analysis of Hardware-Invariant Computational Primitives in Parallel Processors
par: Abraham, Ojima, et autres
Publié: (2026)
par: Abraham, Ojima, et autres
Publié: (2026)
TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications
par: Bian, Zhuohang, et autres
Publié: (2025)
par: Bian, Zhuohang, et autres
Publié: (2025)
Directives for Function Offloading in 5G Networks Based on a Performance Characteristics Analysis
par: Dettinger, Falk, et autres
Publié: (2025)
par: Dettinger, Falk, et autres
Publié: (2025)
Shaved Ice: Optimal Compute Resource Commitments for Dynamic Multi-Cloud Workloads
par: Stokely, Murray, et autres
Publié: (2025)
par: Stokely, Murray, et autres
Publié: (2025)
Alea-BFT: Practical Asynchronous Byzantine Fault Tolerance
par: Antunes, Diogo S., et autres
Publié: (2024)
par: Antunes, Diogo S., et autres
Publié: (2024)
Laminar: A Probe-First Scheduling Paradigm with Deterministic Runtime Survival
par: Chu, Zhengyan
Publié: (2026)
par: Chu, Zhengyan
Publié: (2026)
Flex-MIG: Enabling Distributed Execution on MIG
par: Kim, Myeongsu, et autres
Publié: (2025)
par: Kim, Myeongsu, et autres
Publié: (2025)
Shipwright: Proving liveness of distributed systems with Byzantine participants
par: Leung, Derek, et autres
Publié: (2025)
par: Leung, Derek, et autres
Publié: (2025)
Rank-Aware Resource Scheduling for Tightly-Coupled MPI Workloads on Kubernetes
par: Xie, Tianfang
Publié: (2026)
par: Xie, Tianfang
Publié: (2026)
Trident: Adaptive Scheduling for Heterogeneous Multimodal Data Pipelines
par: Pan, Ding, et autres
Publié: (2026)
par: Pan, Ding, et autres
Publié: (2026)
Studying the Effect of Schedule Preemption on Dynamic Task Graph Scheduling
par: Khodabandehlou, Mohammadali, et autres
Publié: (2026)
par: Khodabandehlou, Mohammadali, et autres
Publié: (2026)
GPUnion: Autonomous GPU Sharing on Campus
par: Li, Yufang, et autres
Publié: (2025)
par: Li, Yufang, et autres
Publié: (2025)
RACS-SADL: Robust and Understandable Randomized Consensus in the Cloud
par: Tennage, Pasindu, et autres
Publié: (2024)
par: Tennage, Pasindu, et autres
Publié: (2024)
Baxos: Backing off for Robust and Efficient Consensus
par: Tennage, Pasindu, et autres
Publié: (2022)
par: Tennage, Pasindu, et autres
Publié: (2022)
ZenFlow: Enabling Stall-Free Offloading Training via Asynchronous Updates
par: Lan, Tingfeng, et autres
Publié: (2025)
par: Lan, Tingfeng, et autres
Publié: (2025)
Rebooting Microreboot: Architectural Support for Safe, Parallel Recovery in Microservice Systems
par: Bindschaedler, Laurent
Publié: (2026)
par: Bindschaedler, Laurent
Publié: (2026)
Breaking (Global) Barriers in Parallel Stochastic Optimization with Wait-Avoiding Group Averaging
par: Li, Shigang, et autres
Publié: (2020)
par: Li, Shigang, et autres
Publié: (2020)
Efficiently Scheduling Parallel DAG Tasks on Identical Multiprocessors
par: Lendve, Shardul, et autres
Publié: (2024)
par: Lendve, Shardul, et autres
Publié: (2024)
Verifying In-Network Computing Systems for Design Risks
par: Bai, Tianyu, et autres
Publié: (2026)
par: Bai, Tianyu, et autres
Publié: (2026)
dpBento: Benchmarking DPUs for Data Processing
par: Hu, Jiasheng, et autres
Publié: (2025)
par: Hu, Jiasheng, et autres
Publié: (2025)
Documents similaires
-
Dodoor: Efficient Randomized Decentralized Scheduling with Load Caching for Heterogeneous Tasks and Clusters
par: Da, Wei, et autres
Publié: (2025) -
NotebookOS: A Replicated Notebook Platform for Interactive Training with On-Demand GPUs
par: Carver, Benjamin, et autres
Publié: (2025) -
Limitless FaaS: Overcoming serverless functions execution time limits with invoke driven architecture and memory checkpoints
par: Andraca, Rodrigo Landa, et autres
Publié: (2024) -
Efficient and Reuseable Cloud Configuration Search Using Discovery Spaces
par: Johnston, Michael, et autres
Publié: (2025) -
Cloud Uptime Archive: Open-Access Availability Data of Web, Cloud, and Gaming Services
par: Talluri, Sacheendra, et autres
Publié: (2025)