Harvest: Opportunistic Peer-to-Peer GPU Caching for LLM Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Gopal, Nikhil, Kaffes, Kostis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shabari: Delayed Decision-Making for Faster and Efficient Serverless Functions
di: Sinha, Prasoon, et al.
Pubblicazione: (2024)
di: Sinha, Prasoon, et al.
Pubblicazione: (2024)
AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent
di: Hua, Wenyue, et al.
Pubblicazione: (2026)
di: Hua, Wenyue, et al.
Pubblicazione: (2026)
PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review
di: Margalit, Yanki, et al.
Pubblicazione: (2026)
di: Margalit, Yanki, et al.
Pubblicazione: (2026)
P4: Towards private, personalized, and Peer-to-Peer learning
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2024)
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2024)
Backdoor Attacks in Peer-to-Peer Federated Learning
di: Syros, Georgios, et al.
Pubblicazione: (2023)
di: Syros, Georgios, et al.
Pubblicazione: (2023)
Scalable Fairness Shaping with LLM-Guided Multi-Agent Reinforcement Learning for Peer-to-Peer Electricity Markets
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
Peer-to-Peer Learning Dynamics of Wide Neural Networks
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
LiteCache: A Query Similarity-Driven, GPU-Centric KVCache Subsystem for Efficient LLM Inference
di: Yi, Jiawei, et al.
Pubblicazione: (2025)
di: Yi, Jiawei, et al.
Pubblicazione: (2025)
Fortytwo: Swarm Inference with Peer-Ranked Consensus
di: Larin, Vladyslav, et al.
Pubblicazione: (2025)
di: Larin, Vladyslav, et al.
Pubblicazione: (2025)
Toward Robust and Efficient ML-Based GPU Caching for Modern Inference
di: Chen, Peng, et al.
Pubblicazione: (2025)
di: Chen, Peng, et al.
Pubblicazione: (2025)
Randomly Initialized Networks Can Learn from Peer-to-Peer Consensus
di: Rodríguez-Betancourt, Esteban, et al.
Pubblicazione: (2026)
di: Rodríguez-Betancourt, Esteban, et al.
Pubblicazione: (2026)
Peer-to-Peer Deep Learning for Beyond-5G IoT
di: Pranav, Srinivasa, et al.
Pubblicazione: (2023)
di: Pranav, Srinivasa, et al.
Pubblicazione: (2023)
MAR-FL: A Communication Efficient Peer-to-Peer Federated Learning System
di: Mulitze, Felix, et al.
Pubblicazione: (2025)
di: Mulitze, Felix, et al.
Pubblicazione: (2025)
FairMarket-RL: LLM-Guided Fairness Shaping for Multi-Agent Reinforcement Learning in Peer-to-Peer Markets
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
di: Jadhav, Shrenik, et al.
Pubblicazione: (2025)
Reinforcement Learning Enabled Peer-to-Peer Energy Trading for Dairy Farms
di: Shah, Mian Ibad Ali, et al.
Pubblicazione: (2024)
di: Shah, Mian Ibad Ali, et al.
Pubblicazione: (2024)
Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
di: Wang, Dong, et al.
Pubblicazione: (2025)
di: Wang, Dong, et al.
Pubblicazione: (2025)
Muffliato: Peer-to-Peer Privacy Amplification for Decentralized Optimization and Averaging
di: Cyffers, Edwige, et al.
Pubblicazione: (2022)
di: Cyffers, Edwige, et al.
Pubblicazione: (2022)
Opportunistic Routing in Wireless Communications via Learnable State-Augmented Policies
di: Das, Sourajit, et al.
Pubblicazione: (2025)
di: Das, Sourajit, et al.
Pubblicazione: (2025)
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
Benchmarking federated strategies in Peer-to-Peer Federated learning for biomedical data
di: Salmeron, Jose L., et al.
Pubblicazione: (2024)
di: Salmeron, Jose L., et al.
Pubblicazione: (2024)
ScholarPeer: A Context-Aware Multi-Agent Framework for Automated Peer Review
di: Goyal, Palash, et al.
Pubblicazione: (2026)
di: Goyal, Palash, et al.
Pubblicazione: (2026)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
di: Yao, Jiayi, et al.
Pubblicazione: (2026)
di: Yao, Jiayi, et al.
Pubblicazione: (2026)
PeerAiD: Improving Adversarial Distillation from a Specialized Peer Tutor
di: Jung, Jaewon, et al.
Pubblicazione: (2024)
di: Jung, Jaewon, et al.
Pubblicazione: (2024)
Client Clustering Meets Knowledge Sharing: Enhancing Privacy and Robustness in Personalized Peer-to-Peer Learning
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2025)
Learning to Collaborate: An Orchestrated-Decentralized Framework for Peer-to-Peer LLM Federation
di: Singh, Inderjeet, et al.
Pubblicazione: (2026)
di: Singh, Inderjeet, et al.
Pubblicazione: (2026)
Resilient Peer-to-peer Learning based on Adaptive Aggregation
di: Bhowmick, Chandreyee, et al.
Pubblicazione: (2025)
di: Bhowmick, Chandreyee, et al.
Pubblicazione: (2025)
Peering Partner Recommendation for ISPs using Machine Learning
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2025)
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2025)
Learning from Peers: Collaborative Ensemble Adversarial Training
di: Dengjin, Li, et al.
Pubblicazione: (2025)
di: Dengjin, Li, et al.
Pubblicazione: (2025)
Peer-to-Peer Energy Trading of Solar and Energy Storage: A Networked Multiagent Reinforcement Learning Approach
di: Feng, Chen, et al.
Pubblicazione: (2024)
di: Feng, Chen, et al.
Pubblicazione: (2024)
PEARL: Peer-Enhanced Adaptive Radio via On-Device LLM
di: Lee, Ju-Hyung, et al.
Pubblicazione: (2025)
di: Lee, Ju-Hyung, et al.
Pubblicazione: (2025)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
di: Song, Dinghong, et al.
Pubblicazione: (2025)
di: Song, Dinghong, et al.
Pubblicazione: (2025)
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
Mustafar: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference
di: Joo, Donghyeon, et al.
Pubblicazione: (2025)
di: Joo, Donghyeon, et al.
Pubblicazione: (2025)
XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
di: Tomar, Aditya, et al.
Pubblicazione: (2025)
di: Tomar, Aditya, et al.
Pubblicazione: (2025)
Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable
di: Saha, Rounak, et al.
Pubblicazione: (2026)
di: Saha, Rounak, et al.
Pubblicazione: (2026)
HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference
di: Deng, Weishu, et al.
Pubblicazione: (2025)
di: Deng, Weishu, et al.
Pubblicazione: (2025)
The Path to Open Innovation: Peer-Review Under Fire (PRUF)
di: Billions, Ava, et al.
Pubblicazione: (2025)
di: Billions, Ava, et al.
Pubblicazione: (2025)
Opportunistic Expert Activation: Batch-Aware Expert Routing for Faster Decode Without Retraining
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2025)
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2025)
Decoupling Scores and Text: The Politeness Principle in Peer Review
di: Wen, Yingxuan
Pubblicazione: (2026)
di: Wen, Yingxuan
Pubblicazione: (2026)
Altruistic Ride Sharing: A Framework for Fair and Sustainable Urban Mobility via Peer-to-Peer Incentives
di: Singh, Divyanshu, et al.
Pubblicazione: (2025)
di: Singh, Divyanshu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Shabari: Delayed Decision-Making for Faster and Efficient Serverless Functions
di: Sinha, Prasoon, et al.
Pubblicazione: (2024) -
AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent
di: Hua, Wenyue, et al.
Pubblicazione: (2026) -
PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review
di: Margalit, Yanki, et al.
Pubblicazione: (2026) -
P4: Towards private, personalized, and Peer-to-Peer learning
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2024) -
Backdoor Attacks in Peer-to-Peer Federated Learning
di: Syros, Georgios, et al.
Pubblicazione: (2023)