Salvato in:
| Autori principali: | Bhardwaj, Ankit, Wang, Weiyang, Carin, Jeremy, Belay, Adam, Ghobadi, Manya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2507.13522 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KaMPIng: Flexible and (Near) Zero-Overhead C++ Bindings for MPI
di: Uhl, Tim Niklas, et al.
Pubblicazione: (2024)
di: Uhl, Tim Niklas, et al.
Pubblicazione: (2024)
MLTCP: Congestion Control for DNN Training
di: Rajasekaran, Sudarsanan, et al.
Pubblicazione: (2024)
di: Rajasekaran, Sudarsanan, et al.
Pubblicazione: (2024)
Near-Zero-Overhead Freshness for Recommendation Systems via Inference-Side Model Updates
di: Yu, Wenjun, et al.
Pubblicazione: (2025)
di: Yu, Wenjun, et al.
Pubblicazione: (2025)
Optimizing Frequent Checkpointing via Low-Cost Differential for Distributed Training Systems
di: Yao, Chenxuan, et al.
Pubblicazione: (2025)
di: Yao, Chenxuan, et al.
Pubblicazione: (2025)
Scaling LLM Inference Beyond Amdahl`s Limits via Eliminating Non-Scalable Overheads
di: Zhao, Alan, et al.
Pubblicazione: (2026)
di: Zhao, Alan, et al.
Pubblicazione: (2026)
Benchmarking Compound AI Applications for Hardware-Software Co-Design
di: Samuthrsindh, Paramuth, et al.
Pubblicazione: (2026)
di: Samuthrsindh, Paramuth, et al.
Pubblicazione: (2026)
Asynchronous Checkpoint for Eventually Consistent Databases
di: Ravishankar, Raaghav, et al.
Pubblicazione: (2025)
di: Ravishankar, Raaghav, et al.
Pubblicazione: (2025)
AMSP: Reducing Communication Overhead of ZeRO for Efficient LLM Training
di: Chen, Qiaoling, et al.
Pubblicazione: (2023)
di: Chen, Qiaoling, et al.
Pubblicazione: (2023)
Building State Machine Replication Using Practical Network Synchrony
di: Wan, Yiliang, et al.
Pubblicazione: (2025)
di: Wan, Yiliang, et al.
Pubblicazione: (2025)
Parallelize Over Data Particle Advection: Participation, Ping Pong Particles, and Overhead
di: Wang, Zhe, et al.
Pubblicazione: (2024)
di: Wang, Zhe, et al.
Pubblicazione: (2024)
Understanding and Reducing Metadata-Driven Host Overheads in Sampling-Based GNN Training
di: Gong, Yidong, et al.
Pubblicazione: (2026)
di: Gong, Yidong, et al.
Pubblicazione: (2026)
Modular Architecture for High-Performance and Low Overhead Data Transfers
di: Swargo, Rasman Mubtasim, et al.
Pubblicazione: (2025)
di: Swargo, Rasman Mubtasim, et al.
Pubblicazione: (2025)
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
Scrutinizing Variables for Checkpoint Using Automatic Differentiation
di: Huang, Xin, et al.
Pubblicazione: (2026)
di: Huang, Xin, et al.
Pubblicazione: (2026)
Optimal Checkpoint Interval with Availability as an Objective Function
di: Saxena, Nirmal Raj, et al.
Pubblicazione: (2024)
di: Saxena, Nirmal Raj, et al.
Pubblicazione: (2024)
Checkpoint and Restart: An Energy Consumption Characterization in Clusters
di: Moran, Marina, et al.
Pubblicazione: (2024)
di: Moran, Marina, et al.
Pubblicazione: (2024)
Efficient LLM Inference with Activation Checkpointing and Hybrid Caching
di: Lee, Sanghyeon, et al.
Pubblicazione: (2025)
di: Lee, Sanghyeon, et al.
Pubblicazione: (2025)
Sparse Checkpointing for Fast and Reliable MoE Training
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
LLMTailor: A Layer-wise Tailoring Tool for Efficient Checkpointing of Large Language Models
di: Sun, Minqiu, et al.
Pubblicazione: (2026)
di: Sun, Minqiu, et al.
Pubblicazione: (2026)
Junctiond: Extending FaaS Runtimes with Kernel-Bypass
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
Understanding LLM Checkpoint/Restore I/O Strategies and Patterns
di: Gossman, Mikaila J., et al.
Pubblicazione: (2025)
di: Gossman, Mikaila J., et al.
Pubblicazione: (2025)
CRIU -- Checkpoint Restore in Userspace for computational simulations and scientific applications
di: Andrijauskas, Fabio, et al.
Pubblicazione: (2024)
di: Andrijauskas, Fabio, et al.
Pubblicazione: (2024)
SafarDB: FPGA-Accelerated Distributed Transactions via Replicated Data Types
di: Saberlatibari, Javad, et al.
Pubblicazione: (2026)
di: Saberlatibari, Javad, et al.
Pubblicazione: (2026)
Orbax: Distributed Checkpointing with JAX
di: Gaffney, Colin, et al.
Pubblicazione: (2026)
di: Gaffney, Colin, et al.
Pubblicazione: (2026)
Reliable Replication Protocols on SmartNICs
di: Katebzadeh, M. R. Siavash, et al.
Pubblicazione: (2025)
di: Katebzadeh, M. R. Siavash, et al.
Pubblicazione: (2025)
Undo and Redo Support for Replicated Registers
di: Stewen, Leo, et al.
Pubblicazione: (2024)
di: Stewen, Leo, et al.
Pubblicazione: (2024)
FeedSign: Robust Full-parameter Federated Fine-tuning of Large Models with Extremely Low Communication Overhead of One Bit
di: Cai, Zhijie, et al.
Pubblicazione: (2025)
di: Cai, Zhijie, et al.
Pubblicazione: (2025)
Taming Serverless Cold Starts Through OS Co-Design
di: Holmes, Ben, et al.
Pubblicazione: (2025)
di: Holmes, Ben, et al.
Pubblicazione: (2025)
A Lightweight Approach for State Machine Replication
di: Cachin, Christian, et al.
Pubblicazione: (2025)
di: Cachin, Christian, et al.
Pubblicazione: (2025)
Mangrove: Fast and Parallelizable State Replication for Blockchains
di: Paramonov, Anton, et al.
Pubblicazione: (2025)
di: Paramonov, Anton, et al.
Pubblicazione: (2025)
Approaches to Conflict-free Replicated Data Types
di: Almeida, Paulo Sérgio
Pubblicazione: (2023)
di: Almeida, Paulo Sérgio
Pubblicazione: (2023)
Linearizability and State-Machine Replication: Is it a match?
di: Hauck, Franz J., et al.
Pubblicazione: (2024)
di: Hauck, Franz J., et al.
Pubblicazione: (2024)
The Cost of Garbage Collection for State Machine Replication
di: Liang, Zhiying, et al.
Pubblicazione: (2024)
di: Liang, Zhiying, et al.
Pubblicazione: (2024)
Ocior: Ultra-Fast Asynchronous Leaderless Consensus with Two-Round Finality, Linear Overhead, and Adaptive Security
di: Chen, Jinyuan
Pubblicazione: (2025)
di: Chen, Jinyuan
Pubblicazione: (2025)
NAVIS: Concurrent Search and Update with Low Position-Seeking Overhead in On-SSD Graph-Based Vector Search
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
Coordinated Cooling and Compute Management for AI Datacenters
di: Abera, Nardos Belay, et al.
Pubblicazione: (2026)
di: Abera, Nardos Belay, et al.
Pubblicazione: (2026)
A Unified, Practical, and Understandable Model of Non-transactional Consistency Levels in Distributed Replication
di: Hu, Guanzhou, et al.
Pubblicazione: (2024)
di: Hu, Guanzhou, et al.
Pubblicazione: (2024)
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
di: Wang, Kewei, et al.
Pubblicazione: (2025)
di: Wang, Kewei, et al.
Pubblicazione: (2025)
Wait-free Replicated Data Types and Fair Reconciliation
di: Kuznetsov, Petr, et al.
Pubblicazione: (2025)
di: Kuznetsov, Petr, et al.
Pubblicazione: (2025)
Resilience through Automated Adaptive Configuration for Distribution and Replication
di: Stoller, Scott D., et al.
Pubblicazione: (2025)
di: Stoller, Scott D., et al.
Pubblicazione: (2025)
Documenti analoghi
-
KaMPIng: Flexible and (Near) Zero-Overhead C++ Bindings for MPI
di: Uhl, Tim Niklas, et al.
Pubblicazione: (2024) -
MLTCP: Congestion Control for DNN Training
di: Rajasekaran, Sudarsanan, et al.
Pubblicazione: (2024) -
Near-Zero-Overhead Freshness for Recommendation Systems via Inference-Side Model Updates
di: Yu, Wenjun, et al.
Pubblicazione: (2025) -
Optimizing Frequent Checkpointing via Low-Cost Differential for Distributed Training Systems
di: Yao, Chenxuan, et al.
Pubblicazione: (2025) -
Scaling LLM Inference Beyond Amdahl`s Limits via Eliminating Non-Scalable Overheads
di: Zhao, Alan, et al.
Pubblicazione: (2026)