AIvailable: A Software-Defined Architecture for LLM-as-a-Service on Heterogeneous and Legacy GPUs
Fuente:
arXiv
Guardado en:
| Autores principales: | Antunes, Pedro, Ortigoso, Ana Rita, Vieira, Gabriel, Fuentes, Daniel, Frazão, Luís, Costa, Nuno, Pereira, António |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diving into 3D Parallelism with Heterogeneous Spot Instance GPUs: Design and Implications
por: Wang, Yuxiao, et al.
Publicado: (2025)
por: Wang, Yuxiao, et al.
Publicado: (2025)
BlockSDN: Towards a High-Performance Blockchain via Software-Defined Cross Networking optimization
por: Jia, Wenyang, et al.
Publicado: (2025)
por: Jia, Wenyang, et al.
Publicado: (2025)
Experimental Validation of User Experience-focused Dynamic Onboard Service Orchestration for Software Defined Vehicles
por: Laclau, Pierre, et al.
Publicado: (2024)
por: Laclau, Pierre, et al.
Publicado: (2024)
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
por: Yang, Zheming, et al.
Publicado: (2024)
por: Yang, Zheming, et al.
Publicado: (2024)
Toward Edge General Intelligence with Multiple-Large Language Model (Multi-LLM): Architecture, Trust, and Orchestration
por: Luo, Haoxiang, et al.
Publicado: (2025)
por: Luo, Haoxiang, et al.
Publicado: (2025)
RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems
por: Feng, Yinxiao, et al.
Publicado: (2025)
por: Feng, Yinxiao, et al.
Publicado: (2025)
Architectural Blueprint For Heterogeneity-Resilient Federated Learning
por: Bashir, Satwat, et al.
Publicado: (2024)
por: Bashir, Satwat, et al.
Publicado: (2024)
Swarm Network-as-a-Service (SNaaS)
por: Alkouz, Balsam, et al.
Publicado: (2026)
por: Alkouz, Balsam, et al.
Publicado: (2026)
Dynamic DAG-Application Scheduling for Multi-Tier Edge Computing in Heterogeneous Networks
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Placing Timely Refreshing Services at the Network Edge
por: Li, Xishuo, et al.
Publicado: (2024)
por: Li, Xishuo, et al.
Publicado: (2024)
Heterogeneity-aware P2P Wireless Energy Transfer for Balanced Energy Distribution
por: Ojha, Tamoghna, et al.
Publicado: (2022)
por: Ojha, Tamoghna, et al.
Publicado: (2022)
Uber's Failover Architecture: Reconciling Reliability and Efficiency in Hyperscale Microservice Infrastructure
por: Bansal, Mayank, et al.
Publicado: (2026)
por: Bansal, Mayank, et al.
Publicado: (2026)
Topology-aware Microservice Architecture in Edge Networks: Deployment Optimization and Implementation
por: Chen, Yuang, et al.
Publicado: (2025)
por: Chen, Yuang, et al.
Publicado: (2025)
On Effectiveness of Graph Neural Network Architectures for Network Digital Twins (NDTs)
por: Zacarias, Iulisloi, et al.
Publicado: (2025)
por: Zacarias, Iulisloi, et al.
Publicado: (2025)
Towards Timely Video Analytics Services at the Network Edge
por: Li, Xishuo, et al.
Publicado: (2024)
por: Li, Xishuo, et al.
Publicado: (2024)
Enabling Blockchain Interoperability Through Network Discovery Services
por: Hassan, Khalid, et al.
Publicado: (2025)
por: Hassan, Khalid, et al.
Publicado: (2025)
Meili: Enabling SmartNIC as a Service in the Cloud
por: Su, Qiang, et al.
Publicado: (2023)
por: Su, Qiang, et al.
Publicado: (2023)
SARS: A Resource Selection Algorithm for Autonomous Driving Tasks in Heterogeneous Mobile Edge Computing
por: Zakerian, Reza, et al.
Publicado: (2024)
por: Zakerian, Reza, et al.
Publicado: (2024)
PeerSync: Accelerating Containerized Service Delivery at the Network Edge
por: Deng, Yinuo, et al.
Publicado: (2025)
por: Deng, Yinuo, et al.
Publicado: (2025)
MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
por: Tang, Lingfeng, et al.
Publicado: (2025)
por: Tang, Lingfeng, et al.
Publicado: (2025)
A Hodge-Based Framework for Service Operational Analysis in Serverless Platforms
por: Reali, Gianluca, et al.
Publicado: (2026)
por: Reali, Gianluca, et al.
Publicado: (2026)
Multitier Service Migration Framework Based on Mobility Prediction in Mobile Edge Computing
por: Yang, Run, et al.
Publicado: (2024)
por: Yang, Run, et al.
Publicado: (2024)
ZipperChain: Transmuting Trusted Third-Party Services Into Trustless Atomic Broadcast
por: Bjornsson, Matteo, et al.
Publicado: (2025)
por: Bjornsson, Matteo, et al.
Publicado: (2025)
Multi-stage Flow Scheduling for LLM Serving
por: Sun, Yijun, et al.
Publicado: (2026)
por: Sun, Yijun, et al.
Publicado: (2026)
Recursive Offloading for LLM Serving in Multi-tier Networks
por: Wu, Zhiyuan, et al.
Publicado: (2025)
por: Wu, Zhiyuan, et al.
Publicado: (2025)
CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure
por: Ding, Eric, et al.
Publicado: (2026)
por: Ding, Eric, et al.
Publicado: (2026)
Accelerating Stable Matching between Workers and Spatial-Temporal Tasks for Dynamic MCS: A Stagewise Service Trading Approach
por: Qi, Houyi, et al.
Publicado: (2025)
por: Qi, Houyi, et al.
Publicado: (2025)
Temporal-Aware GPU Resource Allocation for Distributed LLM Inference via Reinforcement Learning
por: Du, Chengze, et al.
Publicado: (2025)
por: Du, Chengze, et al.
Publicado: (2025)
An Open API Architecture to Discover the Trustworthy Explanation of Cloud AI Services
por: Wang, Zerui, et al.
Publicado: (2024)
por: Wang, Zerui, et al.
Publicado: (2024)
Semantic-Aware LLM Orchestration for Proactive Resource Management in Predictive Digital Twin Vehicular Networks
por: Ahmadpanah, Seyed Hossein
Publicado: (2025)
por: Ahmadpanah, Seyed Hossein
Publicado: (2025)
RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving
por: Kasnavieh, Hossein Hosseini, et al.
Publicado: (2026)
por: Kasnavieh, Hossein Hosseini, et al.
Publicado: (2026)
SPARC-LoRa: A Scalable, Power-efficient, Affordable, Reliable, and Cloud Service-enabled LoRa Networking System for Agriculture Applications
por: Wang, Xi, et al.
Publicado: (2024)
por: Wang, Xi, et al.
Publicado: (2024)
A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks
por: Han, Mingqi, et al.
Publicado: (2026)
por: Han, Mingqi, et al.
Publicado: (2026)
GORGO: Maximizing KV-Cache Reuse While Minimizing Network Latency in Cross-Region LLM Load Balancing
por: Toniolo, Alessio Ricci, et al.
Publicado: (2026)
por: Toniolo, Alessio Ricci, et al.
Publicado: (2026)
Edge Offloading in Smart Grid
por: Arcas, Gabriel Ioan, et al.
Publicado: (2024)
por: Arcas, Gabriel Ioan, et al.
Publicado: (2024)
SAKURAONE: An Open Ethernet-Based AI HPC System and Its Observed Workload Dynamics in a Single-Tenant LLM Development Environment
por: Konishi, Fumikazu, et al.
Publicado: (2026)
por: Konishi, Fumikazu, et al.
Publicado: (2026)
Performance and Stability of Barrier Mode Parallel Systems with Heterogeneous and Redundant Jobs
por: Walker, Brenton, et al.
Publicado: (2025)
por: Walker, Brenton, et al.
Publicado: (2025)
Reliable Image Transmission in CPS-based Pub/Sub
por: Flores, Everson, et al.
Publicado: (2025)
por: Flores, Everson, et al.
Publicado: (2025)
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
por: Liu, Zedong, et al.
Publicado: (2026)
por: Liu, Zedong, et al.
Publicado: (2026)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
por: Shi, Tianyao, et al.
Publicado: (2024)
por: Shi, Tianyao, et al.
Publicado: (2024)
Ejemplares similares
-
Diving into 3D Parallelism with Heterogeneous Spot Instance GPUs: Design and Implications
por: Wang, Yuxiao, et al.
Publicado: (2025) -
BlockSDN: Towards a High-Performance Blockchain via Software-Defined Cross Networking optimization
por: Jia, Wenyang, et al.
Publicado: (2025) -
Experimental Validation of User Experience-focused Dynamic Onboard Service Orchestration for Software Defined Vehicles
por: Laclau, Pierre, et al.
Publicado: (2024) -
PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services
por: Yang, Zheming, et al.
Publicado: (2024) -
Toward Edge General Intelligence with Multiple-Large Language Model (Multi-LLM): Architecture, Trust, and Orchestration
por: Luo, Haoxiang, et al.
Publicado: (2025)