Robust Implementation of Retrieval-Augmented Generation on Edge-based Computing-in-Memory Architectures
Fuente:
arXiv
Salvato in:
| Autori principali: | Qin, Ruiyang, Yan, Zheyu, Zeng, Dewen, Jia, Zhenge, Liu, Dancheng, Liu, Jianbo, Zheng, Zhi, Cao, Ningyuan, Ni, Kai, Xiong, Jinjun, Shi, Yiyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
di: Hong, Guihang, et al.
Pubblicazione: (2025)
di: Hong, Guihang, et al.
Pubblicazione: (2025)
Mapping Gemma3 onto an Edge Dataflow Architecture
di: Du, Shouyu, et al.
Pubblicazione: (2026)
di: Du, Shouyu, et al.
Pubblicazione: (2026)
Barrier-Augmented Lagrangian for GPU-based Elastodynamic Contact
di: Guo, Dewen, et al.
Pubblicazione: (2024)
di: Guo, Dewen, et al.
Pubblicazione: (2024)
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
di: Lin, Chien-Yu, et al.
Pubblicazione: (2025)
di: Lin, Chien-Yu, et al.
Pubblicazione: (2025)
Some New Approaches to MPI Implementations
di: Xiong, Yuqing
Pubblicazione: (2024)
di: Xiong, Yuqing
Pubblicazione: (2024)
EdgeSphere: A Three-Tier Architecture for Cognitive Edge Computing
di: Makaya, Christian, et al.
Pubblicazione: (2024)
di: Makaya, Christian, et al.
Pubblicazione: (2024)
What Cannot Be Implemented on Weak Memory?
di: Castañeda, Armando, et al.
Pubblicazione: (2024)
di: Castañeda, Armando, et al.
Pubblicazione: (2024)
Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding
di: Ye, Shengyuan, et al.
Pubblicazione: (2025)
di: Ye, Shengyuan, et al.
Pubblicazione: (2025)
Distributed Retrieval-Augmented Generation
di: Xu, Chenhao, et al.
Pubblicazione: (2025)
di: Xu, Chenhao, et al.
Pubblicazione: (2025)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Arrow: Adaptive Scheduling Mechanisms for Disaggregated LLM Inference Architecture
di: Wu, Yu, et al.
Pubblicazione: (2025)
di: Wu, Yu, et al.
Pubblicazione: (2025)
Online Optimization of DNN Inference Network Utility in Collaborative Edge Computing
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
PVU: Design and Implementation of a Posit Vector Arithmetic Unit (PVU) for Enhanced Floating-Point Computing in Edge and AI Applications
di: Wu, Xinyu, et al.
Pubblicazione: (2025)
di: Wu, Xinyu, et al.
Pubblicazione: (2025)
FedCache: A Knowledge Cache-driven Federated Learning Architecture for Personalized Edge Intelligence
di: Wu, Zhiyuan, et al.
Pubblicazione: (2023)
di: Wu, Zhiyuan, et al.
Pubblicazione: (2023)
IM-PIR: In-Memory Private Information Retrieval
di: Mwaisela, Mpoki, et al.
Pubblicazione: (2025)
di: Mwaisela, Mpoki, et al.
Pubblicazione: (2025)
Trabant: A Serverless Architecture for Multi-Tenant Orbital Edge Computing
di: Pfandzelter, Tobias, et al.
Pubblicazione: (2025)
di: Pfandzelter, Tobias, et al.
Pubblicazione: (2025)
Infer-EDGE: Dynamic DNN Inference Optimization in 'Just-in-time' Edge-AI Implementations
di: Mounesan, Motahare, et al.
Pubblicazione: (2025)
di: Mounesan, Motahare, et al.
Pubblicazione: (2025)
Self-Evolving Distributed Memory Architecture for Scalable AI Systems
di: Li, Zixuan, et al.
Pubblicazione: (2026)
di: Li, Zixuan, et al.
Pubblicazione: (2026)
Memory-aware Adaptive Scheduling of Scientific Workflows on Heterogeneous Architectures
di: Kulagina, Svetlana, et al.
Pubblicazione: (2025)
di: Kulagina, Svetlana, et al.
Pubblicazione: (2025)
DGRAG: Distributed Graph-based Retrieval-Augmented Generation in Edge-Cloud Systems
di: Zhou, Wenqing, et al.
Pubblicazione: (2025)
di: Zhou, Wenqing, et al.
Pubblicazione: (2025)
Data Augmentation and Convolutional Network Architecture Influence on Distributed Learning
di: Jansen, Victor Forattini, et al.
Pubblicazione: (2026)
di: Jansen, Victor Forattini, et al.
Pubblicazione: (2026)
Parallelizing Maximal Clique Enumeration on GPUs
di: Almasri, Mohammad, et al.
Pubblicazione: (2022)
di: Almasri, Mohammad, et al.
Pubblicazione: (2022)
Zero-Execution Retrieval-Augmented Configuration Tuning of Spark Applications
di: Suri, Raunaq, et al.
Pubblicazione: (2025)
di: Suri, Raunaq, et al.
Pubblicazione: (2025)
CHAMP: A Configurable, Hot-Swappable Edge Architecture for Adaptive Biometric Tasks
di: Brogan, Joel, et al.
Pubblicazione: (2025)
di: Brogan, Joel, et al.
Pubblicazione: (2025)
Optimizing CDN Architectures: Multi-Metric Algorithmic Breakthroughs for Edge and Distributed Performance
di: Absur, Md Nurul, et al.
Pubblicazione: (2024)
di: Absur, Md Nurul, et al.
Pubblicazione: (2024)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
di: Cao, Jiahe, et al.
Pubblicazione: (2026)
di: Cao, Jiahe, et al.
Pubblicazione: (2026)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
di: Sun, Mingyu, et al.
Pubblicazione: (2025)
di: Sun, Mingyu, et al.
Pubblicazione: (2025)
MAP-UOT: A Memory-Efficient Approach to Unbalanced Optimal Transport Implementation
di: Sun, Chengyu, et al.
Pubblicazione: (2024)
di: Sun, Chengyu, et al.
Pubblicazione: (2024)
GoldFish: Serverless Actors with Short-Term Memory State for the Edge-Cloud Continuum
di: Marcelino, Cynthia, et al.
Pubblicazione: (2024)
di: Marcelino, Cynthia, et al.
Pubblicazione: (2024)
SkyMemory: A LEO Edge Cache for Transformer Inference Optimization and Scale Out
di: Sandholm, Thomas, et al.
Pubblicazione: (2025)
di: Sandholm, Thomas, et al.
Pubblicazione: (2025)
Edge Intelligence in Satellite-Terrestrial Networks with Hybrid Quantum Computing
di: Huang, Siyue, et al.
Pubblicazione: (2024)
di: Huang, Siyue, et al.
Pubblicazione: (2024)
Enabling Scientific Workflow Scheduling Research in Non-Uniform Memory Access Architectures
di: Vivas, Aurelio, et al.
Pubblicazione: (2025)
di: Vivas, Aurelio, et al.
Pubblicazione: (2025)
Topology-aware Microservice Architecture in Edge Networks: Deployment Optimization and Implementation
di: Chen, Yuang, et al.
Pubblicazione: (2025)
di: Chen, Yuang, et al.
Pubblicazione: (2025)
SynergAI: Edge-to-Cloud Synergy for Architecture-Driven High-Performance Orchestration for AI Inference
di: Stathopoulou, Foteini, et al.
Pubblicazione: (2025)
di: Stathopoulou, Foteini, et al.
Pubblicazione: (2025)
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
di: Chen, Huamin, et al.
Pubblicazione: (2026)
di: Chen, Huamin, et al.
Pubblicazione: (2026)
OOCO: Latency-disaggregated Architecture for Online-Offline Co-locate LLM Serving
di: Wu, Siyu, et al.
Pubblicazione: (2025)
di: Wu, Siyu, et al.
Pubblicazione: (2025)
DRust: Language-Guided Distributed Shared Memory with Fine Granularity, Full Transparency, and Ultra Efficiency
di: Ma, Haoran, et al.
Pubblicazione: (2024)
di: Ma, Haoran, et al.
Pubblicazione: (2024)
AIGC-assisted Federated Learning for Vehicular Edge Intelligence: Vehicle Selection, Resource Allocation and Model Augmentation
di: Qiang, Xianke, et al.
Pubblicazione: (2025)
di: Qiang, Xianke, et al.
Pubblicazione: (2025)
PipeBoost: Resilient Pipelined Architecture for Fast Serverless LLM Scaling
di: Liu, Chongpeng, et al.
Pubblicazione: (2025)
di: Liu, Chongpeng, et al.
Pubblicazione: (2025)
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
di: Hong, Guihang, et al.
Pubblicazione: (2025) -
Mapping Gemma3 onto an Edge Dataflow Architecture
di: Du, Shouyu, et al.
Pubblicazione: (2026) -
Barrier-Augmented Lagrangian for GPU-based Elastodynamic Contact
di: Guo, Dewen, et al.
Pubblicazione: (2024) -
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
di: Lin, Chien-Yu, et al.
Pubblicazione: (2025) -
Some New Approaches to MPI Implementations
di: Xiong, Yuqing
Pubblicazione: (2024)