3D Optimization for AI Inference Scaling: Balancing Accuracy, Cost, and Latency
Fuente:
arXiv
Salvato in:
| Autori principali: | Jung, Minseok, Ricky, Abhas, Chatni, Muhammad Rameez |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation
di: Jung, Minseok, et al.
Pubblicazione: (2026)
di: Jung, Minseok, et al.
Pubblicazione: (2026)
ALADIN: Accuracy-Latency-Aware Design-space Inference Analysis for Embedded AI Accelerators
di: Baldi, T., et al.
Pubblicazione: (2026)
di: Baldi, T., et al.
Pubblicazione: (2026)
Hardware Aware Ensemble Selection for Balancing Predictive Accuracy and Cost
di: Maier, Jannis, et al.
Pubblicazione: (2024)
di: Maier, Jannis, et al.
Pubblicazione: (2024)
Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency
di: Husom, Erik Johannes, et al.
Pubblicazione: (2025)
di: Husom, Erik Johannes, et al.
Pubblicazione: (2025)
MolPaQ: Modular Quantum-Classical Patch Learning for Interpretable Molecular Generation
di: Naqvi, Syed Rameez, et al.
Pubblicazione: (2026)
di: Naqvi, Syed Rameez, et al.
Pubblicazione: (2026)
OCCAM: Towards Cost-Efficient and Accuracy-Aware Classification Inference
di: Ding, Dujian, et al.
Pubblicazione: (2024)
di: Ding, Dujian, et al.
Pubblicazione: (2024)
Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs
di: Kang, Hao, et al.
Pubblicazione: (2025)
di: Kang, Hao, et al.
Pubblicazione: (2025)
Inference Optimization of Foundation Models on AI Accelerators
di: Park, Youngsuk, et al.
Pubblicazione: (2024)
di: Park, Youngsuk, et al.
Pubblicazione: (2024)
Trading-off Accuracy and Communication Cost in Federated Learning
di: Villani, Mattia Jacopo, et al.
Pubblicazione: (2025)
di: Villani, Mattia Jacopo, et al.
Pubblicazione: (2025)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
di: Yadav, Divakar Kumar, et al.
Pubblicazione: (2026)
di: Yadav, Divakar Kumar, et al.
Pubblicazione: (2026)
CEGI: Measuring the trade-off between efficiency and carbon emissions for SLMs and VLMs
di: Kumar, Abhas, et al.
Pubblicazione: (2024)
di: Kumar, Abhas, et al.
Pubblicazione: (2024)
Sensor Calibration Model Balancing Accuracy, Real-time, and Efficiency
di: Yun, Jinyong, et al.
Pubblicazione: (2025)
di: Yun, Jinyong, et al.
Pubblicazione: (2025)
Scalable AI Inference: Performance Analysis and Optimization of AI Model Serving
di: Pham, Hung Cuong, et al.
Pubblicazione: (2026)
di: Pham, Hung Cuong, et al.
Pubblicazione: (2026)
Multi-Resolution End-to-End Deep Neural Network for Optimizing Latency-Accuracy Tradeoff in Autonomous Driving
di: Weng, Qitao, et al.
Pubblicazione: (2026)
di: Weng, Qitao, et al.
Pubblicazione: (2026)
Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
SLM Meets LLM: Balancing Latency, Interpretability and Consistency in Hallucination Detection
di: Hu, Mengya, et al.
Pubblicazione: (2024)
di: Hu, Mengya, et al.
Pubblicazione: (2024)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
di: Shoham, Ofir Ben
Pubblicazione: (2026)
di: Shoham, Ofir Ben
Pubblicazione: (2026)
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
di: Chen, Huamin, et al.
Pubblicazione: (2026)
di: Chen, Huamin, et al.
Pubblicazione: (2026)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Carbon Intensity-Aware Adaptive Inference of DNNs
di: Jung, Jiwan
Pubblicazione: (2024)
di: Jung, Jiwan
Pubblicazione: (2024)
Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling
di: Winston, Caleb, et al.
Pubblicazione: (2026)
di: Winston, Caleb, et al.
Pubblicazione: (2026)
Difficulty-aware Balancing Margin Loss for Long-tailed Recognition
di: Son, Minseok, et al.
Pubblicazione: (2024)
di: Son, Minseok, et al.
Pubblicazione: (2024)
Inference Energy and Latency in AI-Mediated Education: A Learning-per-Watt Analysis of Edge and Cloud Models
di: Khemani, Kushal
Pubblicazione: (2026)
di: Khemani, Kushal
Pubblicazione: (2026)
Flow Matching on General Geometries
di: Chen, Ricky T. Q., et al.
Pubblicazione: (2023)
di: Chen, Ricky T. Q., et al.
Pubblicazione: (2023)
LiteVLM: A Low-Latency Vision-Language Model Inference Pipeline for Resource-Constrained Environments
di: Huang, Jin, et al.
Pubblicazione: (2025)
di: Huang, Jin, et al.
Pubblicazione: (2025)
MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale Deployment
di: Huang, Hanxian, et al.
Pubblicazione: (2026)
di: Huang, Hanxian, et al.
Pubblicazione: (2026)
Optimizing Travel Itineraries with AI Algorithms in a Microservices Architecture: Balancing Cost, Time, Preferences, and Sustainability
di: Barua, Biman, et al.
Pubblicazione: (2024)
di: Barua, Biman, et al.
Pubblicazione: (2024)
Enhancing Financial VQA in Vision Language Models using Intermediate Structured Representations
di: Srivastava, Archita, et al.
Pubblicazione: (2025)
di: Srivastava, Archita, et al.
Pubblicazione: (2025)
Balancing Fairness and Accuracy in Data-Restricted Binary Classification
di: Lazri, Zachary McBride, et al.
Pubblicazione: (2024)
di: Lazri, Zachary McBride, et al.
Pubblicazione: (2024)
Acceleration of Grokking in Learning Arithmetic Operations via Kolmogorov-Arnold Representation
di: Park, Yeachan, et al.
Pubblicazione: (2024)
di: Park, Yeachan, et al.
Pubblicazione: (2024)
How Ensemble Learning Balances Accuracy and Overfitting: A Bias-Variance Perspective on Tabular Data
di: Mohammad, Zubair Ahmed
Pubblicazione: (2025)
di: Mohammad, Zubair Ahmed
Pubblicazione: (2025)
Beyond Synthetic Augmentation: Group-Aware Threshold Calibration for Robust Balanced Accuracy in Imbalanced Learning
di: Gittlin, Hunter
Pubblicazione: (2025)
di: Gittlin, Hunter
Pubblicazione: (2025)
Balancing Fairness, Privacy, and Accuracy: A Multitask Adversarial Framework for Centralized Data-Driven Systems
di: Ekanayake, Imesh, et al.
Pubblicazione: (2026)
di: Ekanayake, Imesh, et al.
Pubblicazione: (2026)
Balancing Graph Embedding Smoothness in Self-Supervised Learning via Information-Theoretic Decomposition
di: Jung, Heesoo, et al.
Pubblicazione: (2025)
di: Jung, Heesoo, et al.
Pubblicazione: (2025)
Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference
di: Khaled, Arindam
Pubblicazione: (2026)
di: Khaled, Arindam
Pubblicazione: (2026)
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
di: Li, Xiangchen, et al.
Pubblicazione: (2025)
di: Li, Xiangchen, et al.
Pubblicazione: (2025)
$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models
di: Bilal, Ahsan, et al.
Pubblicazione: (2026)
di: Bilal, Ahsan, et al.
Pubblicazione: (2026)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
di: Li, Ruixiao, et al.
Pubblicazione: (2025)
di: Li, Ruixiao, et al.
Pubblicazione: (2025)
Dynamic LLM Routing and Selection based on User Preferences: Balancing Performance, Cost, and Ethics
di: Piskala, Deepak Babu, et al.
Pubblicazione: (2025)
di: Piskala, Deepak Babu, et al.
Pubblicazione: (2025)
GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL
di: Liu, Zifan, et al.
Pubblicazione: (2026)
di: Liu, Zifan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation
di: Jung, Minseok, et al.
Pubblicazione: (2026) -
ALADIN: Accuracy-Latency-Aware Design-space Inference Analysis for Embedded AI Accelerators
di: Baldi, T., et al.
Pubblicazione: (2026) -
Hardware Aware Ensemble Selection for Balancing Predictive Accuracy and Cost
di: Maier, Jannis, et al.
Pubblicazione: (2024) -
Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency
di: Husom, Erik Johannes, et al.
Pubblicazione: (2025) -
MolPaQ: Modular Quantum-Classical Patch Learning for Interpretable Molecular Generation
di: Naqvi, Syed Rameez, et al.
Pubblicazione: (2026)