System-performance and cost modeling of Large Language Model training and inference
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Wenzhe, Kundu, Joyjit, Tos, Uras, Kong, Weijiang, Sisto, Giuliano, Evenblij, Timon, Perumkunnil, Manu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Technology solutions targeting the performance of gen-AI inference in resource constrained platforms
by: Kundu, Joyjit, et al.
Published: (2026)
by: Kundu, Joyjit, et al.
Published: (2026)
A System Level Performance Evaluation for Superconducting Digital Systems
by: Kundu, Joyjit, et al.
Published: (2024)
by: Kundu, Joyjit, et al.
Published: (2024)
Calibrating DRAMPower Model for HPC: A Runtime Perspective from Real-Time Measurements
by: Shi, Xinyu, et al.
Published: (2024)
by: Shi, Xinyu, et al.
Published: (2024)
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
by: Kundu, Joyjit, et al.
Published: (2024)
by: Kundu, Joyjit, et al.
Published: (2024)
Hecaton: Training Large Language Models with Scalable Chiplet Systems
by: Huang, Zongle, et al.
Published: (2024)
by: Huang, Zongle, et al.
Published: (2024)
RoMe: Row Granularity Access Memory System for Large Language Models
by: Nam, Hwayong, et al.
Published: (2025)
by: Nam, Hwayong, et al.
Published: (2025)
LintLLM: An Open-Source Verilog Linting Framework Based on Large Language Models
by: Fang, Zhigang, et al.
Published: (2025)
by: Fang, Zhigang, et al.
Published: (2025)
A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration
by: Huang, Wei-Hsing, et al.
Published: (2025)
by: Huang, Wei-Hsing, et al.
Published: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) in Large-Scale Systems
by: Huang, Wei-Hsing, et al.
Published: (2025)
by: Huang, Wei-Hsing, et al.
Published: (2025)
Subitizing-Inspired_Large_Language_Models_for_Floorplanning
by: Lu, Shao-Chien, et al.
Published: (2025)
by: Lu, Shao-Chien, et al.
Published: (2025)
PIM Is All You Need: A CXL-Enabled GPU-Free System for Large Language Model Inference
by: Gu, Yufeng, et al.
Published: (2025)
by: Gu, Yufeng, et al.
Published: (2025)
RTLFixer: Automatically Fixing RTL Syntax Errors with Large Language Models
by: Tsai, Yun-Da, et al.
Published: (2023)
by: Tsai, Yun-Da, et al.
Published: (2023)
Hardware-based Heterogeneous Memory Management for Large Language Model Inference
by: Hwang, Soojin, et al.
Published: (2025)
by: Hwang, Soojin, et al.
Published: (2025)
Managing Hybrid Solid-State Drives Using Large Language Models
by: Wei, Qian, et al.
Published: (2025)
by: Wei, Qian, et al.
Published: (2025)
A Comparison of the Cerebras Wafer-Scale Integration Technology with Nvidia GPU-based Systems for Artificial Intelligence
by: Kundu, Yudhishthira, et al.
Published: (2025)
by: Kundu, Yudhishthira, et al.
Published: (2025)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
by: Duan, Cenlin, et al.
Published: (2025)
by: Duan, Cenlin, et al.
Published: (2025)
Hummingbird: A Smaller and Faster Large Language Model Accelerator on Embedded FPGA
by: Li, Jindong, et al.
Published: (2025)
by: Li, Jindong, et al.
Published: (2025)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
by: Wang, Peipei, et al.
Published: (2025)
by: Wang, Peipei, et al.
Published: (2025)
HAAN: A Holistic Approach for Accelerating Normalization Operations in Large Language Models
by: Peng, Tianfan, et al.
Published: (2025)
by: Peng, Tianfan, et al.
Published: (2025)
AssertFix: Empowering Automated Assertion Fix via Large Language Models
by: Lyu, Hongqin, et al.
Published: (2025)
by: Lyu, Hongqin, et al.
Published: (2025)
Theseus: Exploring Efficient Wafer-Scale Chip Design for Large Language Models
by: Zhu, Jingchen, et al.
Published: (2024)
by: Zhu, Jingchen, et al.
Published: (2024)
Chiplet Cloud: Building AI Supercomputers for Serving Large Generative Language Models
by: Peng, Huwan, et al.
Published: (2023)
by: Peng, Huwan, et al.
Published: (2023)
GeneTEK: Low-power, high-performance and scalable FPGA architecture for exact unit-cost edit distance
by: Espinosa, Elena, et al.
Published: (2025)
by: Espinosa, Elena, et al.
Published: (2025)
SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference
by: Parvathy, Aradhana Mohan, et al.
Published: (2026)
by: Parvathy, Aradhana Mohan, et al.
Published: (2026)
IMMSched: Interruptible Multi-DNN Scheduling via Parallel Multi-Particle Optimizing Subgraph Isomorphism
by: Zhao, Boran, et al.
Published: (2026)
by: Zhao, Boran, et al.
Published: (2026)
SpecLLM: Exploring Generation and Review of VLSI Design Specification with Large Language Model
by: Li, Mengming, et al.
Published: (2024)
by: Li, Mengming, et al.
Published: (2024)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
by: Moon, Seungjae, et al.
Published: (2024)
by: Moon, Seungjae, et al.
Published: (2024)
MatrixFlow: System-Accelerator co-design for high-performance transformer applications
by: Liu, Qunyou, et al.
Published: (2025)
by: Liu, Qunyou, et al.
Published: (2025)
SA-DS: A Dataset for Large Language Model-Driven AI Accelerator Design Generation
by: Vungarala, Deepak, et al.
Published: (2024)
by: Vungarala, Deepak, et al.
Published: (2024)
BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models
by: Han, Xiaomeng, et al.
Published: (2025)
by: Han, Xiaomeng, et al.
Published: (2025)
SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models
by: Xia, Yuhuan, et al.
Published: (2026)
by: Xia, Yuhuan, et al.
Published: (2026)
SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation
by: He, Zicheng, et al.
Published: (2026)
by: He, Zicheng, et al.
Published: (2026)
Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
by: Liu, Yiqi, et al.
Published: (2026)
by: Liu, Yiqi, et al.
Published: (2026)
Large Processor Chip Model
by: Chang, Kaiyan, et al.
Published: (2025)
by: Chang, Kaiyan, et al.
Published: (2025)
ReaLM: Reliable and Efficient Large Language Model Inference with Statistical Algorithm-Based Fault Tolerance
by: Xie, Tong, et al.
Published: (2025)
by: Xie, Tong, et al.
Published: (2025)
EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models
by: Huang, Mingqiang, et al.
Published: (2024)
by: Huang, Mingqiang, et al.
Published: (2024)
Evaluating Large Language Models for Automatic Register Transfer Logic Generation via High-Level Synthesis
by: Swaroopa, Sneha, et al.
Published: (2024)
by: Swaroopa, Sneha, et al.
Published: (2024)
Insights from Rights and Wrongs: A Large Language Model for Solving Assertion Failures in RTL Design
by: Zhou, Jie, et al.
Published: (2025)
by: Zhou, Jie, et al.
Published: (2025)
ITERA-LLM: Boosting Sub-8-Bit Large Language Model Inference via Iterative Tensor Decomposition
by: Zheng, Keran, et al.
Published: (2025)
by: Zheng, Keran, et al.
Published: (2025)
Spec2Assertion: Automatic Pre-RTL Assertion Generation using Large Language Models with Progressive Regularization
by: Wu, Fenghua, et al.
Published: (2025)
by: Wu, Fenghua, et al.
Published: (2025)
Similar Items
-
Technology solutions targeting the performance of gen-AI inference in resource constrained platforms
by: Kundu, Joyjit, et al.
Published: (2026) -
A System Level Performance Evaluation for Superconducting Digital Systems
by: Kundu, Joyjit, et al.
Published: (2024) -
Calibrating DRAMPower Model for HPC: A Runtime Perspective from Real-Time Measurements
by: Shi, Xinyu, et al.
Published: (2024) -
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
by: Kundu, Joyjit, et al.
Published: (2024) -
Hecaton: Training Large Language Models with Scalable Chiplet Systems
by: Huang, Zongle, et al.
Published: (2024)