One Size Does Not Fit All: Architecture-Aware Adaptive Batch Scheduling with DEBA
Fuente:
arXiv
Salvato in:
| Autori principali: | Belias, François, Ezzati-Jivan, Naser, Khomh, Foutse |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Utilizing Graph Neural Networks for Effective Link Prediction in Microservice Architectures
di: Khodabandeh, Ghazal, et al.
Pubblicazione: (2025)
di: Khodabandeh, Ghazal, et al.
Pubblicazione: (2025)
Risk-Aware Batch Testing for Performance Regression Detection
di: Sayedsalehi, Ali, et al.
Pubblicazione: (2026)
di: Sayedsalehi, Ali, et al.
Pubblicazione: (2026)
Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models
di: Wallace, Tom, et al.
Pubblicazione: (2025)
di: Wallace, Tom, et al.
Pubblicazione: (2025)
AutoSAGE: Input-Aware CUDA Scheduling for Sparse GNN Aggregation (SpMM/SDDMM) and CSR Attention
di: Stankovic, Aleksandar
Pubblicazione: (2025)
di: Stankovic, Aleksandar
Pubblicazione: (2025)
MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference
di: Chu, Kexin, et al.
Pubblicazione: (2026)
di: Chu, Kexin, et al.
Pubblicazione: (2026)
Tracing Optimization for Performance Modeling and Regression Detection
di: Shahedi, Kaveh, et al.
Pubblicazione: (2024)
di: Shahedi, Kaveh, et al.
Pubblicazione: (2024)
Uncertainty Quantification for Machine Learning: One Size Does Not Fit All
di: Hofman, Paul, et al.
Pubblicazione: (2025)
di: Hofman, Paul, et al.
Pubblicazione: (2025)
P-MOSS: Scheduling Main-Memory Indexes Over NUMA Servers Using Next Token Prediction
di: Rayhan, Yeasir, et al.
Pubblicazione: (2024)
di: Rayhan, Yeasir, et al.
Pubblicazione: (2024)
A Structure-Aware Framework for Learning Device Placements on Computation Graphs
di: Duan, Shukai, et al.
Pubblicazione: (2024)
di: Duan, Shukai, et al.
Pubblicazione: (2024)
EARL: Energy-Aware Optimization of Liquid State Machines for Pervasive AI
di: Iqbal, Zain, et al.
Pubblicazione: (2026)
di: Iqbal, Zain, et al.
Pubblicazione: (2026)
An Empirical Study on Method-Level Performance Evolution in Open-Source Java Projects
di: Shahedi, Kaveh, et al.
Pubblicazione: (2025)
di: Shahedi, Kaveh, et al.
Pubblicazione: (2025)
Prompt-Aware Scheduling for Low-Latency LLM Serving
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
di: Tao, Yiheng, et al.
Pubblicazione: (2025)
GreenServ: Energy-Efficient Context-Aware Dynamic Routing for Multi-Model LLM Inference
di: Ziller, Thomas, et al.
Pubblicazione: (2026)
di: Ziller, Thomas, et al.
Pubblicazione: (2026)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
di: Lu, Liming, et al.
Pubblicazione: (2026)
di: Lu, Liming, et al.
Pubblicazione: (2026)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
di: Xue, Leyang, et al.
Pubblicazione: (2024)
di: Xue, Leyang, et al.
Pubblicazione: (2024)
Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge
di: Park, Brendan, et al.
Pubblicazione: (2024)
di: Park, Brendan, et al.
Pubblicazione: (2024)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
Toward Smart Scheduling in Tapis
di: Stubbs, Joe, et al.
Pubblicazione: (2024)
di: Stubbs, Joe, et al.
Pubblicazione: (2024)
OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2025)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
USEFUSE: Uniform Stride for Enhanced Performance in Fused Layer Architecture of Deep Neural Networks
di: Ibrahim, Muhammad Sohail, et al.
Pubblicazione: (2024)
di: Ibrahim, Muhammad Sohail, et al.
Pubblicazione: (2024)
GPU Cluster Scheduling for Network-Sensitive Deep Learning
di: Sharma, Aakash, et al.
Pubblicazione: (2024)
di: Sharma, Aakash, et al.
Pubblicazione: (2024)
One Size Does Not Fit All: A Distribution-Aware Sparsification for More Precise Model Merging
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
di: Luo, Yingfeng, et al.
Pubblicazione: (2025)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
A2Q+: Improving Accumulator-Aware Weight Quantization
di: Colbert, Ian, et al.
Pubblicazione: (2024)
di: Colbert, Ian, et al.
Pubblicazione: (2024)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
Is Intelligence the Right Direction in New OS Scheduling for Multiple Resources in Cloud Environments?
di: Dou, Xinglei, et al.
Pubblicazione: (2025)
di: Dou, Xinglei, et al.
Pubblicazione: (2025)
FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system
di: Li, Zeyuan, et al.
Pubblicazione: (2024)
di: Li, Zeyuan, et al.
Pubblicazione: (2024)
One Size Fits All for Semantic Shifts: Adaptive Prompt Tuning for Continual Learning
di: Kim, Doyoung, et al.
Pubblicazione: (2023)
di: Kim, Doyoung, et al.
Pubblicazione: (2023)
ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU
di: Sunesh, Aman, et al.
Pubblicazione: (2026)
di: Sunesh, Aman, et al.
Pubblicazione: (2026)
CPINN-ABPI: Physics-Informed Neural Networks for Accurate Power Estimation in MPSoCs
di: Elshamy, Mohamed R., et al.
Pubblicazione: (2025)
di: Elshamy, Mohamed R., et al.
Pubblicazione: (2025)
DistZO2: High-Throughput and Memory-Efficient Zeroth-Order Fine-tuning LLMs with Distributed Parallel Computing
di: Wang, Liangyu, et al.
Pubblicazione: (2025)
di: Wang, Liangyu, et al.
Pubblicazione: (2025)
PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation
di: An, Zihao, et al.
Pubblicazione: (2025)
di: An, Zihao, et al.
Pubblicazione: (2025)
Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants
di: You, Bozhi, et al.
Pubblicazione: (2025)
di: You, Bozhi, et al.
Pubblicazione: (2025)
Enhancing Tropical Cyclone Path Forecasting with an Improved Transformer Network
di: Van Thanh, Nguyen, et al.
Pubblicazione: (2025)
di: Van Thanh, Nguyen, et al.
Pubblicazione: (2025)
lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
di: Wang, Haoxin, et al.
Pubblicazione: (2025)
di: Wang, Haoxin, et al.
Pubblicazione: (2025)
WCDT: Systematic WCET Optimization for Decision Tree Implementations
di: Hölscher, Nils, et al.
Pubblicazione: (2025)
di: Hölscher, Nils, et al.
Pubblicazione: (2025)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
MLPerf Automotive
di: Shojaei, Radoyeh, et al.
Pubblicazione: (2025)
di: Shojaei, Radoyeh, et al.
Pubblicazione: (2025)
Accuracy and Consumption analysis from a compressed model by CompactifAI from Multiverse Computing
di: Fovet, Damien, et al.
Pubblicazione: (2025)
di: Fovet, Damien, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Utilizing Graph Neural Networks for Effective Link Prediction in Microservice Architectures
di: Khodabandeh, Ghazal, et al.
Pubblicazione: (2025) -
Risk-Aware Batch Testing for Performance Regression Detection
di: Sayedsalehi, Ali, et al.
Pubblicazione: (2026) -
Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models
di: Wallace, Tom, et al.
Pubblicazione: (2025) -
AutoSAGE: Input-Aware CUDA Scheduling for Sparse GNN Aggregation (SpMM/SDDMM) and CSR Attention
di: Stankovic, Aleksandar
Pubblicazione: (2025) -
MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference
di: Chu, Kexin, et al.
Pubblicazione: (2026)