Vortex: Hosting ML Inference and Knowledge Retrieval Services With Tight Latency and Throughput Requirements
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yuting, Yuan, Tiancheng, Hashim, Jamal, Garrett, Thiago, Qian, Jeffrey, Zhang, Ann, Wang, Yifan, Song, Weijia, Birman, Ken |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
par: Yang, Yuting, et autres
Publié: (2024)
par: Yang, Yuting, et autres
Publié: (2024)
Keep Your Friends Close: Leveraging Affinity Groups to Accelerate AI Inference Workflows
par: Garrett, Thiago, et autres
Publié: (2023)
par: Garrett, Thiago, et autres
Publié: (2023)
CALL: Context-Aware Low-Latency Retrieval in Disk-Based Vector Databases
par: Jeong, Yeonwoo, et autres
Publié: (2025)
par: Jeong, Yeonwoo, et autres
Publié: (2025)
CACTUSDB: Unlock Co-Optimization Opportunities for SQL and AI/ML Inferences
par: Zhou, Lixi, et autres
Publié: (2026)
par: Zhou, Lixi, et autres
Publié: (2026)
Optimizing SSD-Resident Graph Indexing for High-Throughput Vector Search
par: Zhao, Weichen, et autres
Publié: (2026)
par: Zhao, Weichen, et autres
Publié: (2026)
CD-ROM Search and Retrieval Software: The Requirements and Realities.
par: Helgerson, Linda W.
Publié: (1986)
par: Helgerson, Linda W.
Publié: (1986)
Biathlon: Harnessing Model Resilience for Accelerating ML Inference Pipelines
par: Chang, Chaokun, et autres
Publié: (2024)
par: Chang, Chaokun, et autres
Publié: (2024)
HARMONY: A Scalable Distributed Vector Database for High-Throughput Approximate Nearest Neighbor Search
par: Xu, Qian, et autres
Publié: (2025)
par: Xu, Qian, et autres
Publié: (2025)
InferF: Declarative Factorization of AI/ML Inferences over Joins
par: Chowdhury, Kanchan, et autres
Publié: (2025)
par: Chowdhury, Kanchan, et autres
Publié: (2025)
GRAB-ANNS: High-Throughput Indexing and Hybrid Search via GPU-Native Bucketing
par: Zhao, Xinkui, et autres
Publié: (2026)
par: Zhao, Xinkui, et autres
Publié: (2026)
Low-Latency Sliding Window Connectivity
par: Zhang, Chao, et autres
Publié: (2024)
par: Zhang, Chao, et autres
Publié: (2024)
VISTA: Knowledge-Driven Vessel Trajectory Imputation with Repair Provenance
par: Liu, Hengyu, et autres
Publié: (2026)
par: Liu, Hengyu, et autres
Publié: (2026)
A Polystore Architecture Using Knowledge Graphs to Support Queries on Heterogeneous Data Stores
par: Azevedo, Leonardo Guerreiro, et autres
Publié: (2023)
par: Azevedo, Leonardo Guerreiro, et autres
Publié: (2023)
Milliscale: Fast Commit on Low-Latency Object Storage
par: Zhou, Jiatang, et autres
Publié: (2026)
par: Zhou, Jiatang, et autres
Publié: (2026)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
par: Wang, Dongwei, et autres
Publié: (2025)
par: Wang, Dongwei, et autres
Publié: (2025)
Tell-Tale Tail Latencies: Pitfalls and Perils in Database Benchmarking
par: Fruth, Michael, et autres
Publié: (2021)
par: Fruth, Michael, et autres
Publié: (2021)
Low-Latency Out-of-Core ANN Search in High-Dimensional Space
par: Song, Ziwen, et autres
Publié: (2026)
par: Song, Ziwen, et autres
Publié: (2026)
Associative Knowledge Graphs for Efficient Sequence Storage and Retrieval
par: Stokłosa, Przemysław, et autres
Publié: (2024)
par: Stokłosa, Przemysław, et autres
Publié: (2024)
High Throughput Shortest Distance Query Processing on Large Dynamic Road Networks
par: Zhou, Xinjie, et autres
Publié: (2024)
par: Zhou, Xinjie, et autres
Publié: (2024)
LinkML: An Open Data Modeling Framework
par: Moxon, Sierra A. T., et autres
Publié: (2025)
par: Moxon, Sierra A. T., et autres
Publié: (2025)
Bringing Data Transformations Near-Memory for Low-Latency Analytics in HTAP Environments
par: Bernhardt, Arthur, et autres
Publié: (2026)
par: Bernhardt, Arthur, et autres
Publié: (2026)
SonicDB S6: A Storage-Efficient Verkle Trie for High-Throughput Blockchains
par: Crisci, Luigi, et autres
Publié: (2026)
par: Crisci, Luigi, et autres
Publié: (2026)
GeoTP: Latency-aware Geo-Distributed Transaction Processing in Database Middlewares (Extended Version)
par: Zhuang, Qiyu, et autres
Publié: (2024)
par: Zhuang, Qiyu, et autres
Publié: (2024)
Streaming Democratized: Ease Across the Latency Spectrum with Delayed View Semantics and Snowflake Dynamic Tables
par: Sotolongo, Daniel, et autres
Publié: (2025)
par: Sotolongo, Daniel, et autres
Publié: (2025)
Tight Fine-Grained Bounds for Direct Access on Join Queries
par: Bringmann, Karl, et autres
Publié: (2022)
par: Bringmann, Karl, et autres
Publié: (2022)
GeoLayer: Towards Low-Latency and Cost-Efficient Geo-Distributed Graph Stores with Layered Graph
par: Yao, Feng, et autres
Publié: (2025)
par: Yao, Feng, et autres
Publié: (2025)
Scalable and Explainable Enterprise Knowledge Discovery Using Graph-Centric Hybrid Retrieval
par: Rao, Nilima, et autres
Publié: (2025)
par: Rao, Nilima, et autres
Publié: (2025)
PentaRAG: Large-Scale Intelligent Knowledge Retrieval for Enterprise LLM Applications
par: Syarubany, Abu Hanif Muhammad, et autres
Publié: (2025)
par: Syarubany, Abu Hanif Muhammad, et autres
Publié: (2025)
Step-by-Step Data Cleaning Recommendations to Improve ML Prediction Accuracy
par: Mohammed, Sedir, et autres
Publié: (2025)
par: Mohammed, Sedir, et autres
Publié: (2025)
DataLens: ML-Oriented Interactive Tabular Data Quality Dashboard
par: Abdelaal, Mohamed, et autres
Publié: (2025)
par: Abdelaal, Mohamed, et autres
Publié: (2025)
Retrieval Augmented Generation using Engineering Design Knowledge
par: Siddharth, L., et autres
Publié: (2023)
par: Siddharth, L., et autres
Publié: (2023)
KG-CQR: Leveraging Structured Relation Representations in Knowledge Graphs for Contextual Query Retrieval
par: Bui, Chi Minh, et autres
Publié: (2025)
par: Bui, Chi Minh, et autres
Publié: (2025)
BubbleRAG: Evidence-Driven Retrieval-Augmented Generation for Black-Box Knowledge Graphs
par: Pan, Duyi, et autres
Publié: (2026)
par: Pan, Duyi, et autres
Publié: (2026)
Comprehensive Evaluation for a Large Scale Knowledge Graph Question Answering Service
par: Potdar, Saloni, et autres
Publié: (2025)
par: Potdar, Saloni, et autres
Publié: (2025)
CLEAR: A Knowledge-Centric Vessel Trajectory Analysis Platform
par: Liu, Hengyu, et autres
Publié: (2026)
par: Liu, Hengyu, et autres
Publié: (2026)
NL4ST: A Natural Language Query Tool for Spatio-Temporal Databases
par: Wang, Xieyang, et autres
Publié: (2026)
par: Wang, Xieyang, et autres
Publié: (2026)
An LLM-Guided Query-Aware Inference System for GNN Models on Large Knowledge Graphs
par: Afandi, Waleed, et autres
Publié: (2026)
par: Afandi, Waleed, et autres
Publié: (2026)
GetBatch: Distributed Multi-Object Retrieval for ML Data Loading
par: Aizman, Alex, et autres
Publié: (2026)
par: Aizman, Alex, et autres
Publié: (2026)
RACOON: An LLM-based Framework for Retrieval-Augmented Column Type Annotation with a Knowledge Graph
par: Wei, Lindsey Linxi, et autres
Publié: (2024)
par: Wei, Lindsey Linxi, et autres
Publié: (2024)
The Climate Change Knowledge Graph: Supporting Climate Services
par: Ceriani, Miguel, et autres
Publié: (2026)
par: Ceriani, Miguel, et autres
Publié: (2026)
Documents similaires
-
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
par: Yang, Yuting, et autres
Publié: (2024) -
Keep Your Friends Close: Leveraging Affinity Groups to Accelerate AI Inference Workflows
par: Garrett, Thiago, et autres
Publié: (2023) -
CALL: Context-Aware Low-Latency Retrieval in Disk-Based Vector Databases
par: Jeong, Yeonwoo, et autres
Publié: (2025) -
CACTUSDB: Unlock Co-Optimization Opportunities for SQL and AI/ML Inferences
par: Zhou, Lixi, et autres
Publié: (2026) -
Optimizing SSD-Resident Graph Indexing for High-Throughput Vector Search
par: Zhao, Weichen, et autres
Publié: (2026)