Efficient, VRAM-Constrained xLM Inference on Clients
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ukarande, Aditya, Shekhar, Deep, Blackstein, Marc, Rangan, Ram |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Splitwiser: Efficient LM inference with constrained resources
par: Aali, Asad, et autres
Publié: (2025)
par: Aali, Asad, et autres
Publié: (2025)
SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
par: Zhang, Hengrui, et autres
Publié: (2025)
par: Zhang, Hengrui, et autres
Publié: (2025)
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
par: Kundu, Joyjit, et autres
Publié: (2024)
par: Kundu, Joyjit, et autres
Publié: (2024)
An End-to-End DNN Inference Framework for the SpiNNaker2 Neuromorphic MPSoC
par: Jobst, Matthias, et autres
Publié: (2025)
par: Jobst, Matthias, et autres
Publié: (2025)
ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs
par: Yang, Jinwu, et autres
Publié: (2026)
par: Yang, Jinwu, et autres
Publié: (2026)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
par: Fan, Ruibo, et autres
Publié: (2026)
par: Fan, Ruibo, et autres
Publié: (2026)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
par: Russo, Enrico, et autres
Publié: (2026)
par: Russo, Enrico, et autres
Publié: (2026)
FastGL: A GPU-Efficient Framework for Accelerating Sampling-Based GNN Training at Large Scale
par: Zhu, Zeyu, et autres
Publié: (2024)
par: Zhu, Zeyu, et autres
Publié: (2024)
Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
par: Meng, William, et autres
Publié: (2025)
par: Meng, William, et autres
Publié: (2025)
SLO-aware GPU Frequency Scaling for Energy Efficient LLM Inference Serving
par: Kakolyris, Andreas Kosmas, et autres
Publié: (2024)
par: Kakolyris, Andreas Kosmas, et autres
Publié: (2024)
Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
par: Ding, Jianru, et autres
Publié: (2026)
par: Ding, Jianru, et autres
Publié: (2026)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
par: Saroliya, Urvij, et autres
Publié: (2024)
par: Saroliya, Urvij, et autres
Publié: (2024)
A Survey on Graph Neural Network Acceleration: Algorithms, Systems, and Customized Hardware
par: Zhang, Shichang, et autres
Publié: (2023)
par: Zhang, Shichang, et autres
Publié: (2023)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
par: Zhu, Yu, et autres
Publié: (2025)
par: Zhu, Yu, et autres
Publié: (2025)
Llumnix: Dynamic Scheduling for Large Language Model Serving
par: Sun, Biao, et autres
Publié: (2024)
par: Sun, Biao, et autres
Publié: (2024)
FlashMoE: Fast Distributed MoE in a Single Kernel
par: Aimuyo, Osayamen Jonathan, et autres
Publié: (2025)
par: Aimuyo, Osayamen Jonathan, et autres
Publié: (2025)
ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
par: Liu, Yiqi, et autres
Publié: (2025)
par: Liu, Yiqi, et autres
Publié: (2025)
F-BFQ: Flexible Block Floating-Point Quantization Accelerator for LLMs
par: Haris, Jude, et autres
Publié: (2025)
par: Haris, Jude, et autres
Publié: (2025)
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
par: Blanco, Francesco G., et autres
Publié: (2024)
par: Blanco, Francesco G., et autres
Publié: (2024)
WWW: What, When, Where to Compute-in-Memory
par: Sharma, Tanvi, et autres
Publié: (2023)
par: Sharma, Tanvi, et autres
Publié: (2023)
MLPerf Power: Benchmarking the Energy Efficiency of Machine Learning Systems from Microwatts to Megawatts for Sustainable AI
par: Tschand, Arya, et autres
Publié: (2024)
par: Tschand, Arya, et autres
Publié: (2024)
LayerDAG: A Layerwise Autoregressive Diffusion Model for Directed Acyclic Graph Generation
par: Li, Mufei, et autres
Publié: (2024)
par: Li, Mufei, et autres
Publié: (2024)
AI and Memory Wall
par: Gholami, Amir, et autres
Publié: (2024)
par: Gholami, Amir, et autres
Publié: (2024)
FedUHD: Unsupervised Federated Learning using Hyperdimensional Computing
par: Lee, You Hak, et autres
Publié: (2025)
par: Lee, You Hak, et autres
Publié: (2025)
Toward Cross-Layer Energy Optimizations in AI Systems
par: Chung, Jae-Won, et autres
Publié: (2024)
par: Chung, Jae-Won, et autres
Publié: (2024)
INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order Gradient Computations in Implicit Neural Representation Processing
par: Abi-Karam, Stefan, et autres
Publié: (2023)
par: Abi-Karam, Stefan, et autres
Publié: (2023)
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
par: Hsia, Samuel, et autres
Publié: (2023)
par: Hsia, Samuel, et autres
Publié: (2023)
Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap
par: Pal, Shagnik, et autres
Publié: (2025)
par: Pal, Shagnik, et autres
Publié: (2025)
Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation
par: Klein, Bernhard, et autres
Publié: (2025)
par: Klein, Bernhard, et autres
Publié: (2025)
A High Energy-Efficiency Multi-core Neuromorphic Architecture for Deep SNN Training
par: Li, Mingjing, et autres
Publié: (2024)
par: Li, Mingjing, et autres
Publié: (2024)
The Feasibility of Implementing Large-Scale Transformers on Multi-FPGA Platforms
par: Gao, Yu, et autres
Publié: (2024)
par: Gao, Yu, et autres
Publié: (2024)
Accelerating Transposed Convolutions on FPGA-based Edge Devices
par: Haris, Jude, et autres
Publié: (2025)
par: Haris, Jude, et autres
Publié: (2025)
JExplore: Design Space Exploration Tool for Nvidia Jetson Boards
par: Kutukcu, Basar, et autres
Publié: (2025)
par: Kutukcu, Basar, et autres
Publié: (2025)
Exploring Parallelism in FPGA-Based Accelerators for Machine Learning Applications
par: Centeno, Sed, et autres
Publié: (2025)
par: Centeno, Sed, et autres
Publié: (2025)
Towards Fair and Firm Real-Time Scheduling in DNN Multi-Tenant Multi-Accelerator Systems via Reinforcement Learning
par: Russo, Enrico, et autres
Publié: (2024)
par: Russo, Enrico, et autres
Publié: (2024)
Integrated Hardware Architecture and Device Placement Search
par: Wang, Irene, et autres
Publié: (2024)
par: Wang, Irene, et autres
Publié: (2024)
Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
par: Yu, Zhongkai, et autres
Publié: (2025)
par: Yu, Zhongkai, et autres
Publié: (2025)
PyGim: An Efficient Graph Neural Network Library for Real Processing-In-Memory Architectures
par: Giannoula, Christina, et autres
Publié: (2024)
par: Giannoula, Christina, et autres
Publié: (2024)
Spira: Exploiting Voxel Data Structural Properties for Efficient Sparse Convolution in Point Cloud Networks
par: Adamopoulos, Dionysios, et autres
Publié: (2025)
par: Adamopoulos, Dionysios, et autres
Publié: (2025)
xPUE: Extending Power Usage Effectiveness Metrics for Cloud Infrastructures
par: Fieni, Guillaume, et autres
Publié: (2025)
par: Fieni, Guillaume, et autres
Publié: (2025)
Documents similaires
-
Splitwiser: Efficient LM inference with constrained resources
par: Aali, Asad, et autres
Publié: (2025) -
SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
par: Zhang, Hengrui, et autres
Publié: (2025) -
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
par: Kundu, Joyjit, et autres
Publié: (2024) -
An End-to-End DNN Inference Framework for the SpiNNaker2 Neuromorphic MPSoC
par: Jobst, Matthias, et autres
Publié: (2025) -
ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs
par: Yang, Jinwu, et autres
Publié: (2026)