Trinity: Disaggregating Vector Search from Prefill-Decode Disaggregation in LLM Serving
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yi, Qian, Chen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Vector Search on Disaggregated Memory with d-HNSW
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
d-HNSW: A High-performance Vector Search Engine on Disaggregated Memory
by: Fang, Fei, et al.
Published: (2026)
by: Fang, Fei, et al.
Published: (2026)
Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
by: Shi, Xiaoxiang, et al.
Published: (2025)
by: Shi, Xiaoxiang, et al.
Published: (2025)
Prefill-Decode Aggregation or Disaggregation? Unifying Both for Goodput-Optimized LLM Serving
by: Wang, Chao, et al.
Published: (2025)
by: Wang, Chao, et al.
Published: (2025)
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
by: Zhong, Yinmin, et al.
Published: (2024)
by: Zhong, Yinmin, et al.
Published: (2024)
Outback: Fast and Communication-efficient Index for Key-Value Store on Disaggregated Memory
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
Disaggregated Database Management Systems
by: Ghandeharizadeh, Shahram, et al.
Published: (2024)
by: Ghandeharizadeh, Shahram, et al.
Published: (2024)
Not All Prefills Are Equal: PPD Disaggregation for Multi-turn LLM Serving
by: Li, Zongze, et al.
Published: (2026)
by: Li, Zongze, et al.
Published: (2026)
SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
by: Zhang, Hengrui, et al.
Published: (2025)
by: Zhang, Hengrui, et al.
Published: (2025)
PrefillShare: A Shared Prefill Module for KV Reuse in Multi-LLM Disaggregated Serving
by: Woo, Sunghyeon, et al.
Published: (2026)
by: Woo, Sunghyeon, et al.
Published: (2026)
SHINE: A Scalable HNSW Index in Disaggregated Memory
by: Widmoser, Manuel, et al.
Published: (2025)
by: Widmoser, Manuel, et al.
Published: (2025)
PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
by: Zhang, Hao, et al.
Published: (2025)
by: Zhang, Hao, et al.
Published: (2025)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
by: Chen, Xing, et al.
Published: (2025)
by: Chen, Xing, et al.
Published: (2025)
VIDEX: A Disaggregated and Extensible Virtual Index for the Cloud and AI Era
by: Kang, Rong, et al.
Published: (2025)
by: Kang, Rong, et al.
Published: (2025)
Cache Coherence Over Disaggregated Memory
by: Wang, Ruihong, et al.
Published: (2024)
by: Wang, Ruihong, et al.
Published: (2024)
SLO-Aware Compute Resource Allocation for Prefill-Decode Disaggregated LLM Inference
by: Li, Luchang, et al.
Published: (2026)
by: Li, Luchang, et al.
Published: (2026)
OffloadFS: Leveraging Disaggregated Storage for Computation Offloading
by: Moon, Sungho, et al.
Published: (2026)
by: Moon, Sungho, et al.
Published: (2026)
DEX: Scalable Range Indexing on Disaggregated Memory [Extended Version]
by: Lu, Baotong, et al.
Published: (2024)
by: Lu, Baotong, et al.
Published: (2024)
Evolution of Buffer Management in Database Systems: From Classical Algorithms to Machine Learning and Disaggregated Memory
by: Gadupudi, Prudhvi, et al.
Published: (2025)
by: Gadupudi, Prudhvi, et al.
Published: (2025)
O^3-LSM: Maximizing Disaggregated LSM Write Performance via Three-Layer Offloading
by: Lin, Qi, et al.
Published: (2026)
by: Lin, Qi, et al.
Published: (2026)
CIDER: Boosting Memory-Disaggregated Key-Value Stores with Pessimistic Synchronization
by: Du, Yuxuan, et al.
Published: (2026)
by: Du, Yuxuan, et al.
Published: (2026)
Spatially Disaggregated Energy Consumption and Emissions in End-use Sectors for Germany and Spain
by: Patil, Shruthi, et al.
Published: (2025)
by: Patil, Shruthi, et al.
Published: (2025)
TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference
by: Tang, Xiaojuan, et al.
Published: (2025)
by: Tang, Xiaojuan, et al.
Published: (2025)
DUET: Disaggregated Hybrid Mamba-Transformer LLMs with Prefill and Decode-Specific Packages
by: Kanani, Alish, et al.
Published: (2026)
by: Kanani, Alish, et al.
Published: (2026)
RelServe: Fast LLM Inference Serving on Relational Data
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
Cronus: Efficient LLM inference on Heterogeneous GPU Clusters via Partially Disaggregated Prefill
by: Liu, Yunzhao, et al.
Published: (2025)
by: Liu, Yunzhao, et al.
Published: (2025)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
by: Ruan, Chaoyi, et al.
Published: (2025)
by: Ruan, Chaoyi, et al.
Published: (2025)
MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool
by: Hu, Cunchen, et al.
Published: (2024)
by: Hu, Cunchen, et al.
Published: (2024)
The Virtuous Cycle: AI-Powered Vector Search and Vector Search-Augmented AI
by: Wei, Jiuqi, et al.
Published: (2026)
by: Wei, Jiuqi, et al.
Published: (2026)
TigerVector: Supporting Vector Search in Graph Databases for Advanced RAGs
by: Liu, Shige, et al.
Published: (2025)
by: Liu, Shige, et al.
Published: (2025)
Stream2LLM: Overlap Context Streaming and Prefill for Reduced Time-to-First-Token (TTFT)
by: Bachkaniwala, Rajveer, et al.
Published: (2026)
by: Bachkaniwala, Rajveer, et al.
Published: (2026)
HARMONY: A Scalable Distributed Vector Database for High-Throughput Approximate Nearest Neighbor Search
by: Xu, Qian, et al.
Published: (2025)
by: Xu, Qian, et al.
Published: (2025)
Cracking Vector Search Indexes
by: Mageirakos, Vasilis, et al.
Published: (2025)
by: Mageirakos, Vasilis, et al.
Published: (2025)
Optimizing SSD-Resident Graph Indexing for High-Throughput Vector Search
by: Zhao, Weichen, et al.
Published: (2026)
by: Zhao, Weichen, et al.
Published: (2026)
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
by: Kumar, Satyam, et al.
Published: (2026)
by: Kumar, Satyam, et al.
Published: (2026)
Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving
by: Qin, Ruoyu, et al.
Published: (2024)
by: Qin, Ruoyu, et al.
Published: (2024)
Efficient Multi-round LLM Inference over Disaggregated Serving
by: He, Wenhao, et al.
Published: (2026)
by: He, Wenhao, et al.
Published: (2026)
Approximate Vector Set Search Inspired by Fly Olfactory Neural System
by: Li, Yiqi, et al.
Published: (2024)
by: Li, Yiqi, et al.
Published: (2024)
The CAP Principle for LLM Serving: A Survey of Long-Context Large Language Model Serving
by: Zeng, Pai, et al.
Published: (2024)
by: Zeng, Pai, et al.
Published: (2024)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
by: Shi, Tianyao, et al.
Published: (2024)
by: Shi, Tianyao, et al.
Published: (2024)
Similar Items
-
Efficient Vector Search on Disaggregated Memory with d-HNSW
by: Liu, Yi, et al.
Published: (2025) -
d-HNSW: A High-performance Vector Search Engine on Disaggregated Memory
by: Fang, Fei, et al.
Published: (2026) -
Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
by: Shi, Xiaoxiang, et al.
Published: (2025) -
Prefill-Decode Aggregation or Disaggregation? Unifying Both for Goodput-Optimized LLM Serving
by: Wang, Chao, et al.
Published: (2025) -
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
by: Zhong, Yinmin, et al.
Published: (2024)