Keep Your Friends Close: Leveraging Affinity Groups to Accelerate AI Inference Workflows
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Garrett, Thiago, Song, Weijia, Vitenberg, Roman, Birman, Ken |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
par: Yang, Yuting, et autres
Publié: (2024)
par: Yang, Yuting, et autres
Publié: (2024)
On Replacing Cryptopuzzles with Useful Computation in Blockchain Proof-of-Work Protocols
par: Merlina, Andrea, et autres
Publié: (2024)
par: Merlina, Andrea, et autres
Publié: (2024)
Exploiting Inter-Layer Expert Affinity for Accelerating Mixture-of-Experts Model Inference
par: Yao, Jinghan, et autres
Publié: (2024)
par: Yao, Jinghan, et autres
Publié: (2024)
A Discussion about Computational Challenges of Programmable Money in Blockchain-based CBDCs
par: da Conceição, Arlindo F., et autres
Publié: (2024)
par: da Conceição, Arlindo F., et autres
Publié: (2024)
Reconstruction-Based Adaptive Scheduling Using AI Inferences in Safety-Critical Systems
par: Alshaer, Samer, et autres
Publié: (2025)
par: Alshaer, Samer, et autres
Publié: (2025)
Accelerating LLM Inference with Precomputed Query Storage
par: Park, Jay H., et autres
Publié: (2025)
par: Park, Jay H., et autres
Publié: (2025)
The (R)evolution of Scientific Workflows in the Agentic AI Era: Towards Autonomous Science
par: Shin, Woong, et autres
Publié: (2025)
par: Shin, Woong, et autres
Publié: (2025)
Scalable AI-assisted Workflow Management for Detector Design Optimization Using Distributed Computing
par: Anderson, Derek, et autres
Publié: (2026)
par: Anderson, Derek, et autres
Publié: (2026)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
par: Xu, Jiaming, et autres
Publié: (2025)
par: Xu, Jiaming, et autres
Publié: (2025)
Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity
par: Zhu, Wenbin, et autres
Publié: (2025)
par: Zhu, Wenbin, et autres
Publié: (2025)
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
par: Hwang, Changho, et autres
Publié: (2025)
par: Hwang, Changho, et autres
Publié: (2025)
Decentralized AI: Permissionless LLM Inference on POKT Network
par: Olshansky, Daniel, et autres
Publié: (2024)
par: Olshansky, Daniel, et autres
Publié: (2024)
Leveraging Large Language Model for Intelligent Log Processing and Autonomous Debugging in Cloud AI Platforms
par: Ji, Cheng, et autres
Publié: (2025)
par: Ji, Cheng, et autres
Publié: (2025)
LegoDiffusion: Micro-Serving Text-to-Image Diffusion Workflows
par: Yang, Lingyun, et autres
Publié: (2026)
par: Yang, Lingyun, et autres
Publié: (2026)
Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines
par: Wagenländer, Marcel, et autres
Publié: (2026)
par: Wagenländer, Marcel, et autres
Publié: (2026)
Accelerating a Triton Fused Kernel for W4A16 Quantized Inference with SplitK work decomposition
par: Hoque, Adnan, et autres
Publié: (2024)
par: Hoque, Adnan, et autres
Publié: (2024)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
par: Xu, Bin, et autres
Publié: (2025)
par: Xu, Bin, et autres
Publié: (2025)
Cloud-Based AI Systems: Leveraging Large Language Models for Intelligent Fault Detection and Autonomous Self-Healing
par: Ji, Cheng, et autres
Publié: (2025)
par: Ji, Cheng, et autres
Publié: (2025)
AI Inference as Relocatable Electricity Demand: A Latency-Constrained Energy-Geography Framework
par: Luo, Xubin, et autres
Publié: (2026)
par: Luo, Xubin, et autres
Publié: (2026)
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
par: Song, Jingwei, et autres
Publié: (2025)
par: Song, Jingwei, et autres
Publié: (2025)
Reinforcement Learning-driven Data-intensive Workflow Scheduling for Volunteer Edge-Cloud
par: Mounesan, Motahare, et autres
Publié: (2024)
par: Mounesan, Motahare, et autres
Publié: (2024)
Electricity Cost Minimization for Multi-Workflow Allocation in Geo-Distributed Data Centers
par: Wang, Shuang, et autres
Publié: (2025)
par: Wang, Shuang, et autres
Publié: (2025)
WORKSWORLD: A Domain for Integrated Numeric Planning and Scheduling of Distributed Pipelined Workflows
par: Paul, Taylor, et autres
Publié: (2026)
par: Paul, Taylor, et autres
Publié: (2026)
Scalable Runtime Architecture for Data-driven, Hybrid HPC and ML Workflow Applications
par: Merzky, Andre, et autres
Publié: (2025)
par: Merzky, Andre, et autres
Publié: (2025)
DeServe: Towards Affordable Offline LLM Inference via Decentralization
par: Wu, Linyu, et autres
Publié: (2025)
par: Wu, Linyu, et autres
Publié: (2025)
Accelerating Latency-Critical Applications with AI-Powered Semi-Automatic Fine-Grained Parallelization on SMT Processors
par: Los, Denis, et autres
Publié: (2025)
par: Los, Denis, et autres
Publié: (2025)
BucketServe: Bucket-Based Dynamic Batching for Smart and Efficient LLM Inference Serving
par: Zheng, Wanyi, et autres
Publié: (2025)
par: Zheng, Wanyi, et autres
Publié: (2025)
Characterizing Performance-Energy Trade-offs of Large Language Models in Multi-Request Workflows
par: Ifath, Md. Monzurul Amin, et autres
Publié: (2026)
par: Ifath, Md. Monzurul Amin, et autres
Publié: (2026)
KAITIAN: A Unified Communication Framework for Enabling Efficient Collaboration Across Heterogeneous Accelerators in Embodied AI Systems
par: Lin, Jieke, et autres
Publié: (2025)
par: Lin, Jieke, et autres
Publié: (2025)
Compass: Optimizing Compound AI Workflows for Dynamic Adaptation
par: Gravara, Milos, et autres
Publié: (2026)
par: Gravara, Milos, et autres
Publié: (2026)
Seesaw: High-throughput LLM Inference via Model Re-sharding
par: Su, Qidong, et autres
Publié: (2025)
par: Su, Qidong, et autres
Publié: (2025)
iOS as Acceleration
par: Chen, Alexander K.
Publié: (2025)
par: Chen, Alexander K.
Publié: (2025)
Accelerating MoE Model Inference with Expert Sharding
par: Balmau, Oana, et autres
Publié: (2025)
par: Balmau, Oana, et autres
Publié: (2025)
Mind the Gap: Revealing Inconsistencies Across Heterogeneous AI Accelerators
par: Wen, Elliott, et autres
Publié: (2025)
par: Wen, Elliott, et autres
Publié: (2025)
FIRST: Federated Inference Resource Scheduling Toolkit for Scientific AI Model Access
par: Tanikanti, Aditya, et autres
Publié: (2025)
par: Tanikanti, Aditya, et autres
Publié: (2025)
Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks
par: Li, Haiyuan, et autres
Publié: (2026)
par: Li, Haiyuan, et autres
Publié: (2026)
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
par: Chen, Le, et autres
Publié: (2025)
par: Chen, Le, et autres
Publié: (2025)
HadaCore: Tensor Core Accelerated Hadamard Transform Kernel
par: Agarwal, Krish, et autres
Publié: (2024)
par: Agarwal, Krish, et autres
Publié: (2024)
Beyond the Buzz: A Pragmatic Take on Inference Disaggregation
par: Mitra, Tiyasa, et autres
Publié: (2025)
par: Mitra, Tiyasa, et autres
Publié: (2025)
Documents similaires
-
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
par: Yang, Yuting, et autres
Publié: (2024) -
On Replacing Cryptopuzzles with Useful Computation in Blockchain Proof-of-Work Protocols
par: Merlina, Andrea, et autres
Publié: (2024) -
Exploiting Inter-Layer Expert Affinity for Accelerating Mixture-of-Experts Model Inference
par: Yao, Jinghan, et autres
Publié: (2024) -
A Discussion about Computational Challenges of Programmable Money in Blockchain-based CBDCs
par: da Conceição, Arlindo F., et autres
Publié: (2024) -
Reconstruction-Based Adaptive Scheduling Using AI Inferences in Safety-Critical Systems
par: Alshaer, Samer, et autres
Publié: (2025)