Computation-Bandwidth-Memory Trade-offs: A Unified Paradigm for AI Infrastructure
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Yuankai, Weng, Qizhen, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Space-Time Trade-off in Bounded Iterated Memory
par: Toyos-Marfurt, Guillermo, et autres
Publié: (2025)
par: Toyos-Marfurt, Guillermo, et autres
Publié: (2025)
Paradigm Shift in Infrastructure Inspection Technology: Leveraging High-performance Imaging and Advanced AI Analytics to Inspect Road Infrastructure
par: Wu, Du, et autres
Publié: (2025)
par: Wu, Du, et autres
Publié: (2025)
Performance Trade-offs of High Order Meshless Approximation on Distributed Memory Systems
par: Vehovar, Jon, et autres
Publié: (2025)
par: Vehovar, Jon, et autres
Publié: (2025)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
par: Duan, Jiangfei, et autres
Publié: (2024)
par: Duan, Jiangfei, et autres
Publié: (2024)
Efficient Unified Caching for Accelerating Heterogeneous AI Workloads
par: Wang, Tianze, et autres
Publié: (2025)
par: Wang, Tianze, et autres
Publié: (2025)
Trade-offs in Decentralized Agentic AI Discovery Across the Compute Continuum
par: Dazzi, Patrizio, et autres
Publié: (2026)
par: Dazzi, Patrizio, et autres
Publié: (2026)
Network-Offloaded Bandwidth-Optimal Broadcast and Allgather for Distributed AI
par: Khalilov, Mikhail, et autres
Publié: (2024)
par: Khalilov, Mikhail, et autres
Publié: (2024)
BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure
par: He, Yiyuan, et autres
Publié: (2025)
par: He, Yiyuan, et autres
Publié: (2025)
A Study on Messaging Trade-offs in Data Streaming for Scientific Workflows
par: George, Anjus, et autres
Publié: (2025)
par: George, Anjus, et autres
Publié: (2025)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
par: Li, Suyi, et autres
Publié: (2024)
par: Li, Suyi, et autres
Publié: (2024)
A 1024 RV-Cores Shared-L1 Cluster with High Bandwidth Memory Link for Low-Latency 6G-SDR
par: Zhang, Yichao, et autres
Publié: (2024)
par: Zhang, Yichao, et autres
Publié: (2024)
6G Infrastructures for Edge AI: An Analytical Perspective
par: Horvath, Kurt, et autres
Publié: (2025)
par: Horvath, Kurt, et autres
Publié: (2025)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing
par: Wang, Yanbo, et autres
Publié: (2026)
par: Wang, Yanbo, et autres
Publié: (2026)
CHIRON: Accelerating Node Synchronization without Security Trade-offs in Distributed Ledgers
par: Neiheiser, Ray, et autres
Publié: (2024)
par: Neiheiser, Ray, et autres
Publié: (2024)
A Space-Time Trade-off for Fast Self-Stabilizing Leader Election in Population Protocols
par: Austin, Henry, et autres
Publié: (2025)
par: Austin, Henry, et autres
Publié: (2025)
EPIC: An Energy-Efficient, High-Performance GPGPU Computing Research Infrastructure
par: Själander, Magnus, et autres
Publié: (2019)
par: Själander, Magnus, et autres
Publié: (2019)
Federated Single Sign-On and Zero Trust Co-design for AI and HPC Digital Research Infrastructures
par: Alam, Sadaf R., et autres
Publié: (2024)
par: Alam, Sadaf R., et autres
Publié: (2024)
Tutorial: Object as a Service (OaaS) Serverless Cloud Computing Paradigm
par: Lertpongrujikorn, Pawissanutt, et autres
Publié: (2024)
par: Lertpongrujikorn, Pawissanutt, et autres
Publié: (2024)
Bandwidth-Aware LLM Inference on Heterogeneous Many-Core Supercomputers
par: Lu, Yao, et autres
Publié: (2026)
par: Lu, Yao, et autres
Publié: (2026)
PUSHtap: PIM-based In-Memory HTAP with Unified Data Storage Format
par: Zhao, Yilong, et autres
Publié: (2025)
par: Zhao, Yilong, et autres
Publié: (2025)
SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation
par: Xiong, Yifan, et autres
Publié: (2024)
par: Xiong, Yifan, et autres
Publié: (2024)
Literature Study on Operational Data Analytics Frameworks in Large-scale Computing Infrastructures
par: Suman, Shekhar, et autres
Publié: (2026)
par: Suman, Shekhar, et autres
Publié: (2026)
M$^2$-MFP: A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure
par: Xie, Hongyi, et autres
Publié: (2025)
par: Xie, Hongyi, et autres
Publié: (2025)
Bandwidth-Aware Network Topology Optimization for Decentralized Learning
par: Shen, Yipeng, et autres
Publié: (2025)
par: Shen, Yipeng, et autres
Publié: (2025)
The Carnot Bound: Limits and Possibilities for Bandwidth-Efficient Consensus
par: Lewis-Pye, Andrew, et autres
Publié: (2026)
par: Lewis-Pye, Andrew, et autres
Publié: (2026)
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
par: Wang, Weiye, et autres
Publié: (2026)
par: Wang, Weiye, et autres
Publié: (2026)
RL over Commodity Networks: Overcoming the Bandwidth Barrier with Lossless Sparse Deltas
par: Ruan, Chaoyi, et autres
Publié: (2026)
par: Ruan, Chaoyi, et autres
Publié: (2026)
Self-Evolving Distributed Memory Architecture for Scalable AI Systems
par: Li, Zixuan, et autres
Publié: (2026)
par: Li, Zixuan, et autres
Publié: (2026)
Low Latency, High Bandwidth Streaming of Experimental Data with EJFAT
par: Baldin, Ilya, et autres
Publié: (2025)
par: Baldin, Ilya, et autres
Publié: (2025)
Exploring Performance-Productivity Trade-offs in AMT Runtimes: A Task Bench Study of Itoyori, ItoyoriFBC, HPX, and MPI
par: Lahnor, Torben R., et autres
Publié: (2026)
par: Lahnor, Torben R., et autres
Publié: (2026)
Memory and Bandwidth are All You Need for Fully Sharded Data Parallel
par: Wang, Jiangtao, et autres
Publié: (2025)
par: Wang, Jiangtao, et autres
Publié: (2025)
DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference
par: Wu, Yongtong, et autres
Publié: (2026)
par: Wu, Yongtong, et autres
Publié: (2026)
A Unified Programming Model for Heterogeneous Computing with CPU and Accelerator Technologies
par: Xiong, Yuqing
Publié: (2022)
par: Xiong, Yuqing
Publié: (2022)
Repurposing of the Run 2 CMS High Level Trigger Infrastructure as a Cloud Resource for Offline Computing
par: Mascheroni, Marco, et autres
Publié: (2024)
par: Mascheroni, Marco, et autres
Publié: (2024)
Edge AI in Highly Volatile Environments: Is Fairness Worth the Accuracy Trade-off?
par: Zaland, Obaidullah, et autres
Publié: (2025)
par: Zaland, Obaidullah, et autres
Publié: (2025)
System-Level Performance Modeling of Photonic In-Memory Computing
par: Arockiaraj, Jebacyril, et autres
Publié: (2026)
par: Arockiaraj, Jebacyril, et autres
Publié: (2026)
Incremental GNN Embedding Computation on Streaming Graphs
par: Wang, Qiange, et autres
Publié: (2026)
par: Wang, Qiange, et autres
Publié: (2026)
WANify: Gauging and Balancing Runtime WAN Bandwidth for Geo-distributed Data Analytics
par: Mohapatra, Anshuman Das, et autres
Publié: (2025)
par: Mohapatra, Anshuman Das, et autres
Publié: (2025)
BSODiag: A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems
par: Duan, Tao, et autres
Publié: (2025)
par: Duan, Tao, et autres
Publié: (2025)
Documents similaires
-
Space-Time Trade-off in Bounded Iterated Memory
par: Toyos-Marfurt, Guillermo, et autres
Publié: (2025) -
Paradigm Shift in Infrastructure Inspection Technology: Leveraging High-performance Imaging and Advanced AI Analytics to Inspect Road Infrastructure
par: Wu, Du, et autres
Publié: (2025) -
Performance Trade-offs of High Order Meshless Approximation on Distributed Memory Systems
par: Vehovar, Jon, et autres
Publié: (2025) -
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
par: Duan, Jiangfei, et autres
Publié: (2024) -
Efficient Unified Caching for Accelerating Heterogeneous AI Workloads
par: Wang, Tianze, et autres
Publié: (2025)