Inference Acceleration for Large Language Models on CPUs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | PS, Ditto, VG, Jithin, MS, Adarsh |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
von: VG, Jithin, et al.
Veröffentlicht: (2025)
von: VG, Jithin, et al.
Veröffentlicht: (2025)
Efficient Hybrid Inference for LLMs: Reward-Based Token Modelling with Selective Cloud Assistance
von: MS, Adarsh, et al.
Veröffentlicht: (2024)
von: MS, Adarsh, et al.
Veröffentlicht: (2024)
ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs
von: Xu, Yuzhuang, et al.
Veröffentlicht: (2026)
von: Xu, Yuzhuang, et al.
Veröffentlicht: (2026)
Distributed Inference Performance Optimization for LLMs on CPUs
von: He, Pujiang, et al.
Veröffentlicht: (2024)
von: He, Pujiang, et al.
Veröffentlicht: (2024)
DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models
von: Huang, You-Liang, et al.
Veröffentlicht: (2026)
von: Huang, You-Liang, et al.
Veröffentlicht: (2026)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
von: Wolfson-Pou, Jordi, et al.
Veröffentlicht: (2025)
von: Wolfson-Pou, Jordi, et al.
Veröffentlicht: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
von: Chen, Fahao, et al.
Veröffentlicht: (2025)
von: Chen, Fahao, et al.
Veröffentlicht: (2025)
LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models
von: Park, Gunho, et al.
Veröffentlicht: (2022)
von: Park, Gunho, et al.
Veröffentlicht: (2022)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification
von: Miao, Xupeng, et al.
Veröffentlicht: (2023)
von: Miao, Xupeng, et al.
Veröffentlicht: (2023)
A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine
von: Li, Anran, et al.
Veröffentlicht: (2026)
von: Li, Anran, et al.
Veröffentlicht: (2026)
InferCept: Efficient Intercept Support for Augmented Large Language Model Inference
von: Abhyankar, Reyna, et al.
Veröffentlicht: (2024)
von: Abhyankar, Reyna, et al.
Veröffentlicht: (2024)
Challenging GPU Dominance: When CPUs Outperform for On-Device LLM Inference
von: Zhang, Haolin, et al.
Veröffentlicht: (2025)
von: Zhang, Haolin, et al.
Veröffentlicht: (2025)
SLO-Aware Scheduling for Large Language Model Inferences
von: Huang, Jinqi, et al.
Veröffentlicht: (2025)
von: Huang, Jinqi, et al.
Veröffentlicht: (2025)
Characterizing Communication Patterns in Distributed Large Language Model Inference
von: Xu, Lang, et al.
Veröffentlicht: (2025)
von: Xu, Lang, et al.
Veröffentlicht: (2025)
Analyzing the Performance Portability of SYCL across CPUs, GPUs, and Hybrid Systems with SW Sequence Alignment
von: Costanzo, Manuel, et al.
Veröffentlicht: (2024)
von: Costanzo, Manuel, et al.
Veröffentlicht: (2024)
Improved Decision Module Selection for Hierarchical Inference in Resource-Constrained Edge Devices
von: Behera, Adarsh Prasad, et al.
Veröffentlicht: (2024)
von: Behera, Adarsh Prasad, et al.
Veröffentlicht: (2024)
Token Level Routing Inference System for Edge Devices
von: She, Jianshu, et al.
Veröffentlicht: (2025)
von: She, Jianshu, et al.
Veröffentlicht: (2025)
ScalableHD: Scalable and High-Throughput Hyperdimensional Computing Inference on Multi-Core CPUs
von: Parikh, Dhruv, et al.
Veröffentlicht: (2025)
von: Parikh, Dhruv, et al.
Veröffentlicht: (2025)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025)
von: Ma, Chenxiang, et al.
Veröffentlicht: (2025)
Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities
von: Chen, Zhixiong, et al.
Veröffentlicht: (2026)
von: Chen, Zhixiong, et al.
Veröffentlicht: (2026)
A dynamic parallel method for performance optimization on hybrid CPUs
von: Yu, Luo, et al.
Veröffentlicht: (2024)
von: Yu, Luo, et al.
Veröffentlicht: (2024)
Folding Tensor and Sequence Parallelism for Memory-Efficient Transformer Training & Inference
von: Shyam, Vasu, et al.
Veröffentlicht: (2026)
von: Shyam, Vasu, et al.
Veröffentlicht: (2026)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
von: He, Zifan, et al.
Veröffentlicht: (2026)
von: He, Zifan, et al.
Veröffentlicht: (2026)
PipeInfer: Accelerating LLM Inference using Asynchronous Pipelined Speculation
von: Butler, Branden, et al.
Veröffentlicht: (2024)
von: Butler, Branden, et al.
Veröffentlicht: (2024)
ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training
von: Lin, Wenxiang, et al.
Veröffentlicht: (2026)
von: Lin, Wenxiang, et al.
Veröffentlicht: (2026)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
von: Jiang, Youhe, et al.
Veröffentlicht: (2023)
von: Jiang, Youhe, et al.
Veröffentlicht: (2023)
λScale: Enabling Fast Scaling for Serverless Large Language Model Inference
von: Yu, Minchen, et al.
Veröffentlicht: (2025)
von: Yu, Minchen, et al.
Veröffentlicht: (2025)
An Explorative Study on Distributed Computing Techniques in Training and Inference of Large Language Models
von: Hakim, Sheikh Azizul, et al.
Veröffentlicht: (2025)
von: Hakim, Sheikh Azizul, et al.
Veröffentlicht: (2025)
TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators
von: Li, Wei, et al.
Veröffentlicht: (2025)
von: Li, Wei, et al.
Veröffentlicht: (2025)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
von: Qian, Yulei, et al.
Veröffentlicht: (2024)
von: Qian, Yulei, et al.
Veröffentlicht: (2024)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
von: Yi, Jinjun, et al.
Veröffentlicht: (2025)
von: Yi, Jinjun, et al.
Veröffentlicht: (2025)
Comparison of Vectorization Capabilities of Different Compilers for X86 and ARM CPUs
von: Sakib, Nazmus, et al.
Veröffentlicht: (2025)
von: Sakib, Nazmus, et al.
Veröffentlicht: (2025)
Towards High-Performance and Portable Molecular Docking on CPUs through Vectorization
von: Accordi, Gianmarco, et al.
Veröffentlicht: (2025)
von: Accordi, Gianmarco, et al.
Veröffentlicht: (2025)
TokenSim: Enabling Hardware and Software Exploration for Large Language Model Inference Systems
von: Wu, Feiyang, et al.
Veröffentlicht: (2025)
von: Wu, Feiyang, et al.
Veröffentlicht: (2025)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
von: Du, Kuntai, et al.
Veröffentlicht: (2025)
von: Du, Kuntai, et al.
Veröffentlicht: (2025)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
von: Xu, Jiaming, et al.
Veröffentlicht: (2025)
von: Xu, Jiaming, et al.
Veröffentlicht: (2025)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
von: Chen, Xing, et al.
Veröffentlicht: (2025)
von: Chen, Xing, et al.
Veröffentlicht: (2025)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
von: Zhao, Yihao, et al.
Veröffentlicht: (2025)
von: Zhao, Yihao, et al.
Veröffentlicht: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
von: Wu, Tian, et al.
Veröffentlicht: (2025)
von: Wu, Tian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
von: VG, Jithin, et al.
Veröffentlicht: (2025) -
Efficient Hybrid Inference for LLMs: Reward-Based Token Modelling with Selective Cloud Assistance
von: MS, Adarsh, et al.
Veröffentlicht: (2024) -
ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs
von: Xu, Yuzhuang, et al.
Veröffentlicht: (2026) -
Distributed Inference Performance Optimization for LLMs on CPUs
von: He, Pujiang, et al.
Veröffentlicht: (2024) -
DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models
von: Huang, You-Liang, et al.
Veröffentlicht: (2026)