Accelerating Latency-Critical Applications with AI-Powered Semi-Automatic Fine-Grained Parallelization on SMT Processors
Fuente:
arXiv
Salvato in:
| Autori principali: | Los, Denis, Petushkov, Igor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Fine-grained Task Parallelism on Simultaneous Multithreading Cores
di: Los, Denis, et al.
Pubblicazione: (2024)
di: Los, Denis, et al.
Pubblicazione: (2024)
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
di: Pan, Xinglin, et al.
Pubblicazione: (2025)
Rethinking Dynamic Networks and Heterogeneous Computing with Automatic Parallelization
di: Wu, Ruilong, et al.
Pubblicazione: (2025)
di: Wu, Ruilong, et al.
Pubblicazione: (2025)
Astra: Efficient and Money-saving Automatic Parallel Strategies Search on Heterogeneous GPUs
di: Wang, Peiran, et al.
Pubblicazione: (2025)
di: Wang, Peiran, et al.
Pubblicazione: (2025)
On the Impact of White-box Deployment Strategies for Edge AI on Latency and Model Performance
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)
AI Inference as Relocatable Electricity Demand: A Latency-Constrained Energy-Geography Framework
di: Luo, Xubin, et al.
Pubblicazione: (2026)
di: Luo, Xubin, et al.
Pubblicazione: (2026)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
di: Zhao, Long, et al.
Pubblicazione: (2026)
di: Zhao, Long, et al.
Pubblicazione: (2026)
Dora: QoE-Aware Hybrid Parallelism for Distributed Edge AI
di: Jin, Jianli, et al.
Pubblicazione: (2025)
di: Jin, Jianli, et al.
Pubblicazione: (2025)
Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading
di: Yu, Hanfei, et al.
Pubblicazione: (2025)
di: Yu, Hanfei, et al.
Pubblicazione: (2025)
Binary Bleed: Fast Distributed and Parallel Method for Automatic Model Selection
di: Barron, Ryan, et al.
Pubblicazione: (2024)
di: Barron, Ryan, et al.
Pubblicazione: (2024)
ELANA: A Simple Energy and Latency Analyzer for LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
Large Language Model Partitioning for Low-Latency Inference at the Edge
di: Kafetzis, Dimitrios, et al.
Pubblicazione: (2025)
di: Kafetzis, Dimitrios, et al.
Pubblicazione: (2025)
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
di: Yang, Yuting, et al.
Pubblicazione: (2024)
di: Yang, Yuting, et al.
Pubblicazione: (2024)
Designing Datacenter Power Delivery Hierarchies for the AI Era
di: Wilkins, Grant, et al.
Pubblicazione: (2026)
di: Wilkins, Grant, et al.
Pubblicazione: (2026)
Reconstruction-Based Adaptive Scheduling Using AI Inferences in Safety-Critical Systems
di: Alshaer, Samer, et al.
Pubblicazione: (2025)
di: Alshaer, Samer, et al.
Pubblicazione: (2025)
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
di: Song, Jingwei, et al.
Pubblicazione: (2025)
di: Song, Jingwei, et al.
Pubblicazione: (2025)
Latency-Aware 2-Opt Monotonic Local Search for Distributed Constraint Optimization
di: Rachmut, Ben, et al.
Pubblicazione: (2025)
di: Rachmut, Ben, et al.
Pubblicazione: (2025)
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
PopPy: Opportunistically Exploiting Parallelism in Python Compound AI Applications
di: Mell, Stephen, et al.
Pubblicazione: (2026)
di: Mell, Stephen, et al.
Pubblicazione: (2026)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
Keep Your Friends Close: Leveraging Affinity Groups to Accelerate AI Inference Workflows
di: Garrett, Thiago, et al.
Pubblicazione: (2023)
di: Garrett, Thiago, et al.
Pubblicazione: (2023)
Research on Model Parallelism and Data Parallelism Optimization Methods in Large Language Model-Based Recommendation Systems
di: Yang, Haowei, et al.
Pubblicazione: (2025)
di: Yang, Haowei, et al.
Pubblicazione: (2025)
FreeRide: Harvesting Bubbles in Pipeline Parallelism
di: Zhang, Jiashu, et al.
Pubblicazione: (2024)
di: Zhang, Jiashu, et al.
Pubblicazione: (2024)
KAITIAN: A Unified Communication Framework for Enabling Efficient Collaboration Across Heterogeneous Accelerators in Embodied AI Systems
di: Lin, Jieke, et al.
Pubblicazione: (2025)
di: Lin, Jieke, et al.
Pubblicazione: (2025)
CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control
di: Buo, Antoonio, et al.
Pubblicazione: (2026)
di: Buo, Antoonio, et al.
Pubblicazione: (2026)
Collaborative Split Federated Learning with Parallel Training and Aggregation
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2025)
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2025)
Can Large Language Models Write Parallel Code?
di: Nichols, Daniel, et al.
Pubblicazione: (2024)
di: Nichols, Daniel, et al.
Pubblicazione: (2024)
Shared Memory-Aware Latency-Sensitive Message Aggregation for Fine-Grained Communication
di: Chandrasekar, Kavitha, et al.
Pubblicazione: (2024)
di: Chandrasekar, Kavitha, et al.
Pubblicazione: (2024)
iOS as Acceleration
di: Chen, Alexander K.
Pubblicazione: (2025)
di: Chen, Alexander K.
Pubblicazione: (2025)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
di: Cho, Seonghye, et al.
Pubblicazione: (2026)
Opara: Exploiting Operator Parallelism for Expediting DNN Inference on GPUs
di: Chen, Aodong, et al.
Pubblicazione: (2023)
di: Chen, Aodong, et al.
Pubblicazione: (2023)
TAPAS: Fast and Automatic Derivation of Tensor Parallel Strategies for Large Neural Networks
di: Shi, Ziji, et al.
Pubblicazione: (2023)
di: Shi, Ziji, et al.
Pubblicazione: (2023)
SimpleFSDP: Simpler Fully Sharded Data Parallel with torch.compile
di: Zhang, Ruisi, et al.
Pubblicazione: (2024)
di: Zhang, Ruisi, et al.
Pubblicazione: (2024)
HPC-Coder: Modeling Parallel Programs using Large Language Models
di: Nichols, Daniel, et al.
Pubblicazione: (2023)
di: Nichols, Daniel, et al.
Pubblicazione: (2023)
Para-B&B: Load-Balanced Deterministic Parallelization of Solving MIP
di: Zhang, Jinyu, et al.
Pubblicazione: (2026)
di: Zhang, Jinyu, et al.
Pubblicazione: (2026)
RedFuser: An Automatic Operator Fusion Framework for Cascaded Reductions on AI Accelerators
di: Tang, Xinsheng, et al.
Pubblicazione: (2026)
di: Tang, Xinsheng, et al.
Pubblicazione: (2026)
AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
di: Guo, Jihu, et al.
Pubblicazione: (2025)
di: Guo, Jihu, et al.
Pubblicazione: (2025)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
Training Through Failure: Effects of Data Consistency in Parallel Machine Learning Training
di: Cao, Ray, et al.
Pubblicazione: (2024)
di: Cao, Ray, et al.
Pubblicazione: (2024)
Using Sequential Runtime Distributions for the Parallel Speedup Prediction of SAT Local Search
di: Arbelaez, Alejandro, et al.
Pubblicazione: (2024)
di: Arbelaez, Alejandro, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Exploring Fine-grained Task Parallelism on Simultaneous Multithreading Cores
di: Los, Denis, et al.
Pubblicazione: (2024) -
Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
di: Pan, Xinglin, et al.
Pubblicazione: (2025) -
Rethinking Dynamic Networks and Heterogeneous Computing with Automatic Parallelization
di: Wu, Ruilong, et al.
Pubblicazione: (2025) -
Astra: Efficient and Money-saving Automatic Parallel Strategies Search on Heterogeneous GPUs
di: Wang, Peiran, et al.
Pubblicazione: (2025) -
On the Impact of White-box Deployment Strategies for Edge AI on Latency and Model Performance
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)