Enregistré dans:
| Auteurs principaux: | Liu, Banruo, Lin, Wei-Yu, Fang, Minghao, Jiang, Yihan, Lai, Fan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.16397 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JITServe: SLO-aware LLM Serving with Imprecise Request Information
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
Budget-aware Query Tuning: An AutoML Perspective
par: Wu, Wentao, et autres
Publié: (2024)
par: Wu, Wentao, et autres
Publié: (2024)
MaskSearch: Querying Image Masks at Scale
par: He, Dong, et autres
Publié: (2023)
par: He, Dong, et autres
Publié: (2023)
HedraRAG: Coordinating LLM Generation and Database Retrieval in Heterogeneous RAG Serving
par: Hu, Zhengding, et autres
Publié: (2025)
par: Hu, Zhengding, et autres
Publié: (2025)
PolyServe: Efficient Multi-SLO Serving at Scale
par: Zhu, Kan, et autres
Publié: (2025)
par: Zhu, Kan, et autres
Publié: (2025)
The CAP Principle for LLM Serving: A Survey of Long-Context Large Language Model Serving
par: Zeng, Pai, et autres
Publié: (2024)
par: Zeng, Pai, et autres
Publié: (2024)
AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding
par: Li, Zikun, et autres
Publié: (2025)
par: Li, Zikun, et autres
Publié: (2025)
ACE: A Cardinality Estimator for Set-Valued Queries
par: Sheng, Yufan, et autres
Publié: (2025)
par: Sheng, Yufan, et autres
Publié: (2025)
Hydro: Adaptive Query Processing of ML Queries
par: Kakkar, Gaurav Tarlok, et autres
Publié: (2024)
par: Kakkar, Gaurav Tarlok, et autres
Publié: (2024)
RAGPulse: An Open-Source RAG Workload Trace to Optimize RAG Serving Systems
par: Wang, Zhengchao, et autres
Publié: (2025)
par: Wang, Zhengchao, et autres
Publié: (2025)
Efficient Vector Search in the Wild: One Model for Multi-K Queries
par: Peng, Yifan, et autres
Publié: (2026)
par: Peng, Yifan, et autres
Publié: (2026)
SLO-aware GPU Frequency Scaling for Energy Efficient LLM Inference Serving
par: Kakolyris, Andreas Kosmas, et autres
Publié: (2024)
par: Kakolyris, Andreas Kosmas, et autres
Publié: (2024)
RCRank: Multimodal Ranking of Root Causes of Slow Queries in Cloud Database Systems
par: Ouyang, Biao, et autres
Publié: (2025)
par: Ouyang, Biao, et autres
Publié: (2025)
Rethinking Caching for LLM Serving Systems: Beyond Traditional Heuristics
par: Kim, Jungwoo, et autres
Publié: (2025)
par: Kim, Jungwoo, et autres
Publié: (2025)
ResidualPlanner+: a scalable matrix mechanism for marginals and beyond
par: Xiao, Yingtai, et autres
Publié: (2023)
par: Xiao, Yingtai, et autres
Publié: (2023)
Demonstration of MaskSearch: Efficiently Querying Image Masks for Machine Learning Workflows
par: Wei, Lindsey Linxi, et autres
Publié: (2024)
par: Wei, Lindsey Linxi, et autres
Publié: (2024)
Private Queries with Sigma-Counting
par: Gao, Jun, et autres
Publié: (2025)
par: Gao, Jun, et autres
Publié: (2025)
Optimizing LLM Queries in Relational Data Analytics Workloads
par: Liu, Shu, et autres
Publié: (2024)
par: Liu, Shu, et autres
Publié: (2024)
The Unreasonable Effectiveness of LLMs for Query Optimization
par: Akioyamen, Peter, et autres
Publié: (2024)
par: Akioyamen, Peter, et autres
Publié: (2024)
TranSQL+: Serving Large Language Models with SQL on Low-Resource Hardware
par: Sun, Wenbo, et autres
Publié: (2025)
par: Sun, Wenbo, et autres
Publié: (2025)
Low Rank Learning for Offline Query Optimization
par: Yi, Zixuan, et autres
Publié: (2025)
par: Yi, Zixuan, et autres
Publié: (2025)
Predictive Query-based Pipeline for Graph Data
par: Neto, Plácido A Souza
Publié: (2024)
par: Neto, Plácido A Souza
Publié: (2024)
Incorporating Deep Learning Design in Database Queries
par: Lubarsky, Yuval Lev, et autres
Publié: (2026)
par: Lubarsky, Yuval Lev, et autres
Publié: (2026)
Adversarial Query Synthesis via Bayesian Optimization
par: Tao, Jeffrey, et autres
Publié: (2026)
par: Tao, Jeffrey, et autres
Publié: (2026)
Sibyl: Forecasting Time-Evolving Query Workloads
par: Huang, Hanxian, et autres
Publié: (2024)
par: Huang, Hanxian, et autres
Publié: (2024)
EdgeServe: A Streaming System for Decentralized Model Serving
par: Shaowang, Ted, et autres
Publié: (2023)
par: Shaowang, Ted, et autres
Publié: (2023)
Improving DBMS Scheduling Decisions with Fine-grained Performance Prediction on Concurrent Queries -- Extended
par: Wu, Ziniu, et autres
Publié: (2025)
par: Wu, Ziniu, et autres
Publié: (2025)
A Declarative Query Language for Scientific Machine Learning
par: Jamil, Hasan M
Publié: (2024)
par: Jamil, Hasan M
Publié: (2024)
SafeLoad: Efficient Admission Control Framework for Identifying Memory-Overloading Queries in Cloud Data Warehouses
par: Wu, Yifan, et autres
Publié: (2026)
par: Wu, Yifan, et autres
Publié: (2026)
MoMQ: Mixture-of-Experts Enhances Multi-Dialect Query Generation across Relational and Non-Relational Databases
par: Lin, Zhisheng, et autres
Publié: (2024)
par: Lin, Zhisheng, et autres
Publié: (2024)
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
par: Kim, Jang-Hyun, et autres
Publié: (2025)
par: Kim, Jang-Hyun, et autres
Publié: (2025)
SemBench: A Benchmark for Semantic Query Processing Engines
par: Lao, Jiale, et autres
Publié: (2025)
par: Lao, Jiale, et autres
Publié: (2025)
Training-Free Query Optimization via LLM-Based Plan Similarity
par: Vasilenko, Nikita, et autres
Publié: (2025)
par: Vasilenko, Nikita, et autres
Publié: (2025)
RELOAD: A Robust and Efficient Learned Query Optimizer for Database Systems
par: Lee, Seokwon, et autres
Publié: (2026)
par: Lee, Seokwon, et autres
Publié: (2026)
LearnedWMP: Workload Memory Prediction Using Distribution of Query Templates
par: Quader, Shaikh, et autres
Publié: (2024)
par: Quader, Shaikh, et autres
Publié: (2024)
MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment
par: Li, Yufei, et autres
Publié: (2025)
par: Li, Yufei, et autres
Publié: (2025)
Counting Still Counts: Understanding Neural Complex Query Answering Through Query Relaxation
par: Brunink, Yannick, et autres
Publié: (2025)
par: Brunink, Yannick, et autres
Publié: (2025)
Tradeoffs in Processing Queries and Supporting Updates over an ML-Enhanced R-tree
par: Al-Mamun, Abdullah, et autres
Publié: (2025)
par: Al-Mamun, Abdullah, et autres
Publié: (2025)
Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
par: Tang, Zirui, et autres
Publié: (2026)
par: Tang, Zirui, et autres
Publié: (2026)
Cross-domain-aware Worker Selection with Training for Crowdsourced Annotation
par: Sun, Yushi, et autres
Publié: (2024)
par: Sun, Yushi, et autres
Publié: (2024)
Documents similaires
-
JITServe: SLO-aware LLM Serving with Imprecise Request Information
par: Zhang, Wei, et autres
Publié: (2025) -
Budget-aware Query Tuning: An AutoML Perspective
par: Wu, Wentao, et autres
Publié: (2024) -
MaskSearch: Querying Image Masks at Scale
par: He, Dong, et autres
Publié: (2023) -
HedraRAG: Coordinating LLM Generation and Database Retrieval in Heterogeneous RAG Serving
par: Hu, Zhengding, et autres
Publié: (2025) -
PolyServe: Efficient Multi-SLO Serving at Scale
par: Zhu, Kan, et autres
Publié: (2025)