The Race to Efficiency: A New Perspective on AI Scaling Laws
Fuente:
arXiv
Salvato in:
| Autore principale: | Lu, Chien-Ping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalizing Scaling Laws for Dense and Sparse Large Language Models
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
Continued AI Scaling Requires Repeated Efficiency Doublings
di: Lu, Chien-Ping
Pubblicazione: (2026)
di: Lu, Chien-Ping
Pubblicazione: (2026)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
di: Jha, Mayank
Pubblicazione: (2026)
di: Jha, Mayank
Pubblicazione: (2026)
Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study
di: Avinash, MSR
Pubblicazione: (2025)
di: Avinash, MSR
Pubblicazione: (2025)
On the Sustainability of AI Inferences in the Edge
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)
MoEITS: A Green AI approach for simplifying MoE-LLMs
di: Balderas, Luis, et al.
Pubblicazione: (2026)
di: Balderas, Luis, et al.
Pubblicazione: (2026)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
di: Almurshed, Osama, et al.
Pubblicazione: (2025)
di: Almurshed, Osama, et al.
Pubblicazione: (2025)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
Leveraging Speculative Sampling and KV-Cache Optimizations Together for Generative AI using OpenVINO
di: Barad, Haim, et al.
Pubblicazione: (2023)
di: Barad, Haim, et al.
Pubblicazione: (2023)
Comment on paper: Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman Problems
di: Min, Yimeng
Pubblicazione: (2024)
di: Min, Yimeng
Pubblicazione: (2024)
Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing
di: Amin, Lisan Al, et al.
Pubblicazione: (2026)
di: Amin, Lisan Al, et al.
Pubblicazione: (2026)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
di: Tyukin, Georgy
Pubblicazione: (2024)
di: Tyukin, Georgy
Pubblicazione: (2024)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
di: Qiao, Liang, et al.
Pubblicazione: (2025)
di: Qiao, Liang, et al.
Pubblicazione: (2025)
Deploying Open-Source Large Language Models: A performance Analysis
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
Applied Federated Model Personalisation in the Industrial Domain: A Comparative Study
di: Siniosoglou, Ilias, et al.
Pubblicazione: (2024)
di: Siniosoglou, Ilias, et al.
Pubblicazione: (2024)
Towards Generalized Parameter Tuning in Coherent Ising Machines: A Portfolio-Based Approach
di: Hanyu, Tatsuro, et al.
Pubblicazione: (2025)
di: Hanyu, Tatsuro, et al.
Pubblicazione: (2025)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
di: Skaf, Wadie, et al.
Pubblicazione: (2026)
di: Skaf, Wadie, et al.
Pubblicazione: (2026)
Quantum Neural Networks for Wind Energy Forecasting: A Comparative Study of Performance and Scalability with Classical Models
di: Hangun, Batuhan, et al.
Pubblicazione: (2025)
di: Hangun, Batuhan, et al.
Pubblicazione: (2025)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
di: Ellis-Mohr, Austin R., et al.
Pubblicazione: (2025)
di: Ellis-Mohr, Austin R., et al.
Pubblicazione: (2025)
Energy-Aware LLMs: A step towards sustainable AI for downstream applications
di: Tran, Nguyen Phuc, et al.
Pubblicazione: (2025)
di: Tran, Nguyen Phuc, et al.
Pubblicazione: (2025)
Quantifying the Generalization Gap in Seizure Detection: A Large-Scale Empirical Benchmark via the SzCORE Challenge
di: Dan, Jonathan, et al.
Pubblicazione: (2025)
di: Dan, Jonathan, et al.
Pubblicazione: (2025)
KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta
di: Liao, Gang, et al.
Pubblicazione: (2025)
di: Liao, Gang, et al.
Pubblicazione: (2025)
Accelerating AI Performance using Anderson Extrapolation on GPUs
di: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Pubblicazione: (2024)
di: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Pubblicazione: (2024)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
di: Shao, Zishan, et al.
Pubblicazione: (2025)
di: Shao, Zishan, et al.
Pubblicazione: (2025)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
di: Kermani, Arshia, et al.
Pubblicazione: (2025)
di: Kermani, Arshia, et al.
Pubblicazione: (2025)
Exchangeability in Neural Network and its Application to Dynamic Pruning
di: Pu, et al.
Pubblicazione: (2025)
di: Pu, et al.
Pubblicazione: (2025)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
di: Chu, Kexin, et al.
Pubblicazione: (2025)
di: Chu, Kexin, et al.
Pubblicazione: (2025)
AdaGradSelect: An adaptive gradient-guided layer selection method for efficient fine-tuning of SLMs
di: Kumar, Anshul, et al.
Pubblicazione: (2025)
di: Kumar, Anshul, et al.
Pubblicazione: (2025)
Knowledge Distillation for Reservoir-based Classifier: Human Activity Recognition
di: Kagiyama, Masaharu, et al.
Pubblicazione: (2025)
di: Kagiyama, Masaharu, et al.
Pubblicazione: (2025)
Ensuring Reliability of Curated EHR-Derived Data: The Validation of Accuracy for LLM/ML-Extracted Information and Data (VALID) Framework
di: Estevez, Melissa, et al.
Pubblicazione: (2025)
di: Estevez, Melissa, et al.
Pubblicazione: (2025)
EDGC: Entropy-driven Dynamic Gradient Compression for Efficient LLM Training
di: Yi, Qingao, et al.
Pubblicazione: (2025)
di: Yi, Qingao, et al.
Pubblicazione: (2025)
OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025)
Estudio de la eficiencia en la escalabilidad de GPUs para el entrenamiento de Inteligencia Artificial
di: Cortes, David, et al.
Pubblicazione: (2025)
di: Cortes, David, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Generalizing Scaling Laws for Dense and Sparse Large Language Models
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025) -
Continued AI Scaling Requires Repeated Efficiency Doublings
di: Lu, Chien-Ping
Pubblicazione: (2026) -
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
di: Jha, Mayank
Pubblicazione: (2026) -
Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study
di: Avinash, MSR
Pubblicazione: (2025) -
On the Sustainability of AI Inferences in the Edge
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)