TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Chien-Yu, Kamahori, Keisuke, Liu, Yiyu, Shi, Xiaoxiang, Kashyap, Madhav, Gu, Yile, Shao, Rulin, Ye, Zihao, Zhu, Kan, Kadekodi, Rohan, Wang, Stephanie, Krishnamurthy, Arvind, Ceze, Luis, Kasikci, Baris |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
por: Gu, Yile, et al.
Publicado: (2025)
por: Gu, Yile, et al.
Publicado: (2025)
VoxServe: Streaming-Centric Serving System for Speech Language Models
por: Kamahori, Keisuke, et al.
Publicado: (2026)
por: Kamahori, Keisuke, et al.
Publicado: (2026)
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
por: Kamahori, Keisuke, et al.
Publicado: (2024)
por: Kamahori, Keisuke, et al.
Publicado: (2024)
AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
por: Kadekodi, Rohan, et al.
Publicado: (2025)
por: Kadekodi, Rohan, et al.
Publicado: (2025)
Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs
por: Zhu, Kan, et al.
Publicado: (2025)
por: Zhu, Kan, et al.
Publicado: (2025)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
por: Kamahori, Keisuke, et al.
Publicado: (2025)
por: Kamahori, Keisuke, et al.
Publicado: (2025)
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?
por: Kamahori, Keisuke, et al.
Publicado: (2026)
por: Kamahori, Keisuke, et al.
Publicado: (2026)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
por: Zhao, Yilong, et al.
Publicado: (2023)
por: Zhao, Yilong, et al.
Publicado: (2023)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
por: Zhu, Kan, et al.
Publicado: (2024)
por: Zhu, Kan, et al.
Publicado: (2024)
Jenga: Responsive Tiered Memory Management without Thrashing
por: Kadekodi, Rohan, et al.
Publicado: (2025)
por: Kadekodi, Rohan, et al.
Publicado: (2025)
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
por: Ye, Zihao, et al.
Publicado: (2025)
por: Ye, Zihao, et al.
Publicado: (2025)
PolyServe: Efficient Multi-SLO Serving at Scale
por: Zhu, Kan, et al.
Publicado: (2025)
por: Zhu, Kan, et al.
Publicado: (2025)
Scalable and Accurate Application-Level Crash-Consistency Testing via Representative Testing
por: Gu, Yile, et al.
Publicado: (2025)
por: Gu, Yile, et al.
Publicado: (2025)
HypRAG: Hyperbolic Dense Retrieval for Retrieval Augmented Generation
por: Madhu, Hiren, et al.
Publicado: (2026)
por: Madhu, Hiren, et al.
Publicado: (2026)
RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations
por: Chen, I-Hsiang, et al.
Publicado: (2026)
por: Chen, I-Hsiang, et al.
Publicado: (2026)
Prospects of Retrieval Augmented Generation (RAG) for Academic Library Search and Retrieval
por: Bevara, Ravi, et al.
Publicado: (2025)
por: Bevara, Ravi, et al.
Publicado: (2025)
HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction
por: Sarmah, Bhaskarjit, et al.
Publicado: (2024)
por: Sarmah, Bhaskarjit, et al.
Publicado: (2024)
Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)
por: Gerner, Assaf, et al.
Publicado: (2026)
por: Gerner, Assaf, et al.
Publicado: (2026)
CoRAG: Collaborative Retrieval-Augmented Generation
por: Muhamed, Aashiq, et al.
Publicado: (2025)
por: Muhamed, Aashiq, et al.
Publicado: (2025)
Retrieval-Augmented Generation with Graphs (GraphRAG)
por: Han, Haoyu, et al.
Publicado: (2024)
por: Han, Haoyu, et al.
Publicado: (2024)
MV-RAG: Retrieval Augmented Multiview Diffusion
por: Dayani, Yosef, et al.
Publicado: (2025)
por: Dayani, Yosef, et al.
Publicado: (2025)
DuetRAG: Collaborative Retrieval-Augmented Generation
por: Jiao, Dian, et al.
Publicado: (2024)
por: Jiao, Dian, et al.
Publicado: (2024)
Loops On Retrieval Augmented Generation (LoRAG)
por: Thakur, Ayush, et al.
Publicado: (2024)
por: Thakur, Ayush, et al.
Publicado: (2024)
Argos: Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models
por: Gu, Yile, et al.
Publicado: (2025)
por: Gu, Yile, et al.
Publicado: (2025)
GAM-RAG: Gain-Adaptive Memory for Evolving Retrieval in Retrieval-Augmented Generation
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
KiRAG: Knowledge-Driven Iterative Retriever for Enhancing Retrieval-Augmented Generation
por: Fang, Jinyuan, et al.
Publicado: (2025)
por: Fang, Jinyuan, et al.
Publicado: (2025)
PIR-RAG: A System for Private Information Retrieval in Retrieval-Augmented Generation
por: Wang, Baiqiang, et al.
Publicado: (2025)
por: Wang, Baiqiang, et al.
Publicado: (2025)
Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation
por: Zhang, Qianchi, et al.
Publicado: (2026)
por: Zhang, Qianchi, et al.
Publicado: (2026)
TeleOracle: Fine-Tuned Retrieval-Augmented Generation with Long-Context Support for Network
por: Alabbasi, Nouf, et al.
Publicado: (2024)
por: Alabbasi, Nouf, et al.
Publicado: (2024)
Blended RAG: Improving RAG (Retriever-Augmented Generation) Accuracy with Semantic Search and Hybrid Query-Based Retrievers
por: Sawarkar, Kunal, et al.
Publicado: (2024)
por: Sawarkar, Kunal, et al.
Publicado: (2024)
RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning
por: Guo, Yucan, et al.
Publicado: (2025)
por: Guo, Yucan, et al.
Publicado: (2025)
HyperRAG: Reasoning N-ary Facts over Hypergraphs for Retrieval Augmented Generation
por: Lien, Wen-Sheng, et al.
Publicado: (2026)
por: Lien, Wen-Sheng, et al.
Publicado: (2026)
LightRAG: Simple and Fast Retrieval-Augmented Generation
por: Guo, Zirui, et al.
Publicado: (2024)
por: Guo, Zirui, et al.
Publicado: (2024)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
por: Qi, Jingyuan, et al.
Publicado: (2025)
por: Qi, Jingyuan, et al.
Publicado: (2025)
TrustRAG: An Information Assistant with Retrieval Augmented Generation
por: Fan, Yixing, et al.
Publicado: (2025)
por: Fan, Yixing, et al.
Publicado: (2025)
ConfRAG: Confidence-Guided Retrieval-Augmenting Generation
por: Huang, Yin, et al.
Publicado: (2025)
por: Huang, Yin, et al.
Publicado: (2025)
Mesh RAG: Retrieval Augmentation for Autoregressive Mesh Generation
por: Sun, Xiatao, et al.
Publicado: (2025)
por: Sun, Xiatao, et al.
Publicado: (2025)
ImpRAG: Retrieval-Augmented Generation with Implicit Queries
por: Zhang, Wenzheng, et al.
Publicado: (2025)
por: Zhang, Wenzheng, et al.
Publicado: (2025)
Disco-RAG: Discourse-Aware Retrieval-Augmented Generation
por: Liu, Dongqi, et al.
Publicado: (2026)
por: Liu, Dongqi, et al.
Publicado: (2026)
HASH-RAG: Bridging Deep Hashing with Retriever for Efficient, Fine Retrieval and Augmented Generation
por: Guo, Jinyu, et al.
Publicado: (2025)
por: Guo, Jinyu, et al.
Publicado: (2025)
Ejemplares similares
-
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
por: Gu, Yile, et al.
Publicado: (2025) -
VoxServe: Streaming-Centric Serving System for Speech Language Models
por: Kamahori, Keisuke, et al.
Publicado: (2026) -
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
por: Kamahori, Keisuke, et al.
Publicado: (2024) -
AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
por: Kadekodi, Rohan, et al.
Publicado: (2025) -
Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs
por: Zhu, Kan, et al.
Publicado: (2025)