Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
Fuente:
arXiv
Salvato in:
| Autore principale: | Jha, Mayank |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Race to Efficiency: A New Perspective on AI Scaling Laws
di: Lu, Chien-Ping
Pubblicazione: (2025)
di: Lu, Chien-Ping
Pubblicazione: (2025)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
di: Tyukin, Georgy
Pubblicazione: (2024)
di: Tyukin, Georgy
Pubblicazione: (2024)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
di: Almurshed, Osama, et al.
Pubblicazione: (2025)
di: Almurshed, Osama, et al.
Pubblicazione: (2025)
Leveraging Speculative Sampling and KV-Cache Optimizations Together for Generative AI using OpenVINO
di: Barad, Haim, et al.
Pubblicazione: (2023)
di: Barad, Haim, et al.
Pubblicazione: (2023)
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
Comment on paper: Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman Problems
di: Min, Yimeng
Pubblicazione: (2024)
di: Min, Yimeng
Pubblicazione: (2024)
APOLLO: SGD-like Memory, AdamW-level Performance
di: Zhu, Hanqing, et al.
Pubblicazione: (2024)
di: Zhu, Hanqing, et al.
Pubblicazione: (2024)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
di: Shao, Zishan, et al.
Pubblicazione: (2025)
di: Shao, Zishan, et al.
Pubblicazione: (2025)
ECCO: Evidence-Driven Causal Reasoning for Compiler Optimization
di: Pan, Haolin, et al.
Pubblicazione: (2026)
di: Pan, Haolin, et al.
Pubblicazione: (2026)
Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study
di: Avinash, MSR
Pubblicazione: (2025)
di: Avinash, MSR
Pubblicazione: (2025)
On the Sustainability of AI Inferences in the Edge
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
Fairness in Serving Large Language Models
di: Sheng, Ying, et al.
Pubblicazione: (2023)
di: Sheng, Ying, et al.
Pubblicazione: (2023)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
MoEITS: A Green AI approach for simplifying MoE-LLMs
di: Balderas, Luis, et al.
Pubblicazione: (2026)
di: Balderas, Luis, et al.
Pubblicazione: (2026)
Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
di: Kermani, Arshia, et al.
Pubblicazione: (2025)
di: Kermani, Arshia, et al.
Pubblicazione: (2025)
Deploying Open-Source Large Language Models: A performance Analysis
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system
di: Li, Zeyuan, et al.
Pubblicazione: (2024)
di: Li, Zeyuan, et al.
Pubblicazione: (2024)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
Performance Modeling of Data Storage Systems using Generative Models
di: Al-Maeeni, Abdalaziz Rashid, et al.
Pubblicazione: (2023)
di: Al-Maeeni, Abdalaziz Rashid, et al.
Pubblicazione: (2023)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
di: Yin, Wangsong, et al.
Pubblicazione: (2025)
di: Yin, Wangsong, et al.
Pubblicazione: (2025)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
di: Liu, Jiashuo, et al.
Pubblicazione: (2025)
di: Liu, Jiashuo, et al.
Pubblicazione: (2025)
Quantifying the Generalization Gap in Seizure Detection: A Large-Scale Empirical Benchmark via the SzCORE Challenge
di: Dan, Jonathan, et al.
Pubblicazione: (2025)
di: Dan, Jonathan, et al.
Pubblicazione: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
di: Jha, Saurav, et al.
Pubblicazione: (2026)
di: Jha, Saurav, et al.
Pubblicazione: (2026)
Stochastic Q-learning for Large Discrete Action Spaces
di: Fourati, Fares, et al.
Pubblicazione: (2024)
di: Fourati, Fares, et al.
Pubblicazione: (2024)
KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta
di: Liao, Gang, et al.
Pubblicazione: (2025)
di: Liao, Gang, et al.
Pubblicazione: (2025)
Accelerating AI Performance using Anderson Extrapolation on GPUs
di: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Pubblicazione: (2024)
di: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Pubblicazione: (2024)
Ghosted Layers: Unconstrained Activation Alignment for Recovering Layer-Pruned LLMs
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2026)
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2026)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
di: Skaf, Wadie, et al.
Pubblicazione: (2026)
di: Skaf, Wadie, et al.
Pubblicazione: (2026)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
Quantum Neural Networks for Wind Energy Forecasting: A Comparative Study of Performance and Scalability with Classical Models
di: Hangun, Batuhan, et al.
Pubblicazione: (2025)
di: Hangun, Batuhan, et al.
Pubblicazione: (2025)
The Hidden Power of Pure 16-bit Floating-Point Neural Networks
di: Yun, Juyoung, et al.
Pubblicazione: (2023)
di: Yun, Juyoung, et al.
Pubblicazione: (2023)
Documenti analoghi
-
The Race to Efficiency: A New Perspective on AI Scaling Laws
di: Lu, Chien-Ping
Pubblicazione: (2025) -
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
di: Tyukin, Georgy
Pubblicazione: (2024) -
Generalizing Scaling Laws for Dense and Sparse Large Language Models
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025) -
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025) -
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
di: Almurshed, Osama, et al.
Pubblicazione: (2025)