Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Yushang, Lyu, Haotian, Peng, Yike, Sun, Aijia, Jiang, Feng, Han, Xinyue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Research on Personalized Financial Product Recommendation by Integrating Large Language Models and Graph Neural Networks
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
di: Wang, Haoxin, et al.
Pubblicazione: (2025)
di: Wang, Haoxin, et al.
Pubblicazione: (2025)
Energy Efficiency Analysis of Active RIS-enhanced Wireless Network under Power-Sum Constraint
di: Xin, Jingdie, et al.
Pubblicazione: (2025)
di: Xin, Jingdie, et al.
Pubblicazione: (2025)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
di: Tyukin, Georgy
Pubblicazione: (2024)
di: Tyukin, Georgy
Pubblicazione: (2024)
Can Graph Reordering Speed Up Graph Neural Network Training? An Experimental Study
di: Merkel, Nikolai, et al.
Pubblicazione: (2024)
di: Merkel, Nikolai, et al.
Pubblicazione: (2024)
HeteGen: Heterogeneous Parallel Inference for Large Language Models on Resource-Constrained Devices
di: Zhao, Xuanlei, et al.
Pubblicazione: (2024)
di: Zhao, Xuanlei, et al.
Pubblicazione: (2024)
An Experimental Study of Low-Latency Video Streaming over 5G
di: Khan, Imran, et al.
Pubblicazione: (2024)
di: Khan, Imran, et al.
Pubblicazione: (2024)
A Modular Graph-Native Query Optimization Framework
di: Lyu, Bingqing, et al.
Pubblicazione: (2024)
di: Lyu, Bingqing, et al.
Pubblicazione: (2024)
Diversity in Network-Friendly Recommendations
di: Tzimpimpaki, Evangelia, et al.
Pubblicazione: (2024)
di: Tzimpimpaki, Evangelia, et al.
Pubblicazione: (2024)
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
di: Benazir, Afsara, et al.
Pubblicazione: (2025)
di: Benazir, Afsara, et al.
Pubblicazione: (2025)
An Interpretable Latency Model for Speculative Decoding in LLM Serving
di: Kong, Linghao, et al.
Pubblicazione: (2026)
di: Kong, Linghao, et al.
Pubblicazione: (2026)
Distributed Matrix-Based Sampling for Graph Neural Network Training
di: Tripathy, Alok, et al.
Pubblicazione: (2023)
di: Tripathy, Alok, et al.
Pubblicazione: (2023)
Efficient Cold-Start Recommendation via BPE Token-Level Embedding Initialization with LLM
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Exploiting Scheduling Flexibility via State-Based Scheduling When Guaranteeing Worst-Case Services
di: Xu, Yike, et al.
Pubblicazione: (2026)
di: Xu, Yike, et al.
Pubblicazione: (2026)
SysLLMatic: Large Language Models are Software System Optimizers
di: Peng, Huiyun, et al.
Pubblicazione: (2025)
di: Peng, Huiyun, et al.
Pubblicazione: (2025)
EDAN: Towards Understanding Memory Parallelism and Latency Sensitivity in HPC
di: Shen, Siyuan, et al.
Pubblicazione: (2025)
di: Shen, Siyuan, et al.
Pubblicazione: (2025)
Latency and Privacy-Aware Resource Allocation in Vehicular Edge Computing
di: Ahmadvand, Hossein, et al.
Pubblicazione: (2025)
di: Ahmadvand, Hossein, et al.
Pubblicazione: (2025)
Towards A Flexible Accuracy-Oriented Deep Learning Module Inference Latency Prediction Framework for Adaptive Optimization Algorithms
di: Shen, Jingran, et al.
Pubblicazione: (2023)
di: Shen, Jingran, et al.
Pubblicazione: (2023)
SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference
di: Shin, Jiho, et al.
Pubblicazione: (2024)
di: Shin, Jiho, et al.
Pubblicazione: (2024)
Long-term Monitoring of Kernel and Hardware Events to Understand Latency Variance
di: Zhou, Fang, et al.
Pubblicazione: (2026)
di: Zhou, Fang, et al.
Pubblicazione: (2026)
A Study on Inference Latency for Vision Transformers on Mobile Devices
di: Li, Zhuojin, et al.
Pubblicazione: (2025)
di: Li, Zhuojin, et al.
Pubblicazione: (2025)
DSO: A GPU Energy Efficiency Optimizer by Fusing Dynamic and Static Information
di: Wang, Qiang, et al.
Pubblicazione: (2024)
di: Wang, Qiang, et al.
Pubblicazione: (2024)
Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory
di: Ren, Jie, et al.
Pubblicazione: (2025)
di: Ren, Jie, et al.
Pubblicazione: (2025)
Prefetching Cache Optimization Using Graph Neural Networks: A Modular Framework and Conceptual Analysis
di: Qowy, F. I.
Pubblicazione: (2025)
di: Qowy, F. I.
Pubblicazione: (2025)
SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference
di: Cavagna, Hiari Pizzini, et al.
Pubblicazione: (2026)
di: Cavagna, Hiari Pizzini, et al.
Pubblicazione: (2026)
A Latency-Constrained, Gated Recurrent Unit (GRU) Implementation in the Versal AI Engine
di: Sapkas, M., et al.
Pubblicazione: (2025)
di: Sapkas, M., et al.
Pubblicazione: (2025)
PM2Lat: Highly Accurate and Generalized Prediction of DNN Execution Latency on GPUs
di: Le, Truong-Thanh, et al.
Pubblicazione: (2026)
di: Le, Truong-Thanh, et al.
Pubblicazione: (2026)
DF-GNN: Dynamic Fusion Framework for Attention Graph Neural Networks on GPUs
di: Liu, Jiahui, et al.
Pubblicazione: (2024)
di: Liu, Jiahui, et al.
Pubblicazione: (2024)
Forecasting GPU Performance for Deep Learning Training and Inference
di: Lee, Seonho, et al.
Pubblicazione: (2024)
di: Lee, Seonho, et al.
Pubblicazione: (2024)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
Motion-to-Motion Latency Measurement Framework for Connected and Autonomous Vehicle Teleoperation
di: Provost, François, et al.
Pubblicazione: (2025)
di: Provost, François, et al.
Pubblicazione: (2025)
On Latency Predictors for Neural Architecture Search
di: Akhauri, Yash, et al.
Pubblicazione: (2024)
di: Akhauri, Yash, et al.
Pubblicazione: (2024)
Profiling Apple Silicon Performance for ML Training
di: Feng, Dahua, et al.
Pubblicazione: (2025)
di: Feng, Dahua, et al.
Pubblicazione: (2025)
Latency Based Tiling
di: Cashman, Jack
Pubblicazione: (2025)
di: Cashman, Jack
Pubblicazione: (2025)
Modeling the Impact of Fiber Latency on Compute-Communication Overlap in Geo-Distributed Multi-Datacenter AI Training
di: Papavasileiou, Ioannis, et al.
Pubblicazione: (2026)
di: Papavasileiou, Ioannis, et al.
Pubblicazione: (2026)
LoPace: A Lossless Optimized Prompt Accurate Compression Engine for Large Language Model Applications
di: Ulla, Aman
Pubblicazione: (2026)
di: Ulla, Aman
Pubblicazione: (2026)
Fast NF4 Dequantization Kernels for Large Language Model Inference
di: Qi, Xiangbo, et al.
Pubblicazione: (2026)
di: Qi, Xiangbo, et al.
Pubblicazione: (2026)
Optimizing Cloud-native Services with SAGA: A Service Affinity Graph-based Approach
di: Dinh-Tuan, Hai, et al.
Pubblicazione: (2025)
di: Dinh-Tuan, Hai, et al.
Pubblicazione: (2025)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
di: Shao, Zishan, et al.
Pubblicazione: (2025)
di: Shao, Zishan, et al.
Pubblicazione: (2025)
Prompt-Aware Scheduling for Low-Latency LLM Serving
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Research on Personalized Financial Product Recommendation by Integrating Large Language Models and Graph Neural Networks
di: Zhao, Yushang, et al.
Pubblicazione: (2025) -
lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
di: Wang, Haoxin, et al.
Pubblicazione: (2025) -
Energy Efficiency Analysis of Active RIS-enhanced Wireless Network under Power-Sum Constraint
di: Xin, Jingdie, et al.
Pubblicazione: (2025) -
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
di: Tyukin, Georgy
Pubblicazione: (2024) -
Can Graph Reordering Speed Up Graph Neural Network Training? An Experimental Study
di: Merkel, Nikolai, et al.
Pubblicazione: (2024)