CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Guanlong, li, Zhaohan, Zhang, Yao, Zhang, Zheng, Niu, Jianyu, Wu, Ye, Zhang, Yinqian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
NetEcho: From Real-World Streaming Side-Channels to Full LLM Conversation Recovery
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference
di: Chu, Kexin, et al.
Pubblicazione: (2025)
di: Chu, Kexin, et al.
Pubblicazione: (2025)
MPCache: MPC-Friendly KV Cache Eviction for Efficient Private LLM Inference
di: Zeng, Wenxuan, et al.
Pubblicazione: (2025)
di: Zeng, Wenxuan, et al.
Pubblicazione: (2025)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
di: Luo, Zhifan, et al.
Pubblicazione: (2025)
di: Luo, Zhifan, et al.
Pubblicazione: (2025)
Cachemir: Fully Homomorphic Encrypted Inference of Generative Large Language Model with KV Cache
di: Yu, Ye, et al.
Pubblicazione: (2026)
di: Yu, Ye, et al.
Pubblicazione: (2026)
CryptoGen: Secure Transformer Generation with Encrypted KV-Cache Reuse
di: Zhang, Hedong, et al.
Pubblicazione: (2026)
di: Zhang, Hedong, et al.
Pubblicazione: (2026)
TeeRollup: Efficient Rollup Design Using Heterogeneous TEE
di: Wen, Xiaoqing, et al.
Pubblicazione: (2024)
di: Wen, Xiaoqing, et al.
Pubblicazione: (2024)
Bit-Flip Vulnerability of Shared KV-Cache Blocks in LLM Serving Systems
di: Yamamoto, Yuji, et al.
Pubblicazione: (2026)
di: Yamamoto, Yuji, et al.
Pubblicazione: (2026)
Demystifying Private Transactions and Their Impact in PoW and PoS Ethereum
di: Lyu, Xingyu, et al.
Pubblicazione: (2025)
di: Lyu, Xingyu, et al.
Pubblicazione: (2025)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
di: Liu, Mingrui, et al.
Pubblicazione: (2026)
di: Liu, Mingrui, et al.
Pubblicazione: (2026)
BackCache: Mitigating Contention-Based Cache Timing Attacks by Hiding Cache Line Evictions
di: Wang, Quancheng, et al.
Pubblicazione: (2023)
di: Wang, Quancheng, et al.
Pubblicazione: (2023)
Whose Narrative is it Anyway? A KV Cache Manipulation Attack
di: Ganesh, Mukkesh, et al.
Pubblicazione: (2025)
di: Ganesh, Mukkesh, et al.
Pubblicazione: (2025)
MAGE: Mutual Attestation for a Group of Enclaves without Trusted Third Parties
di: Chen, Guoxing, et al.
Pubblicazione: (2020)
di: Chen, Guoxing, et al.
Pubblicazione: (2020)
MECURY: Practical Cross-Chain Exchange via Trusted Hardware
di: Wen, Xiaoqing, et al.
Pubblicazione: (2024)
di: Wen, Xiaoqing, et al.
Pubblicazione: (2024)
Leader Rotation Is Not Enough: Scrutinizing Leadership Democracy of Chained BFT Consensus
di: Tang, Yining, et al.
Pubblicazione: (2025)
di: Tang, Yining, et al.
Pubblicazione: (2025)
Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation
di: Chen, Yufei, et al.
Pubblicazione: (2025)
di: Chen, Yufei, et al.
Pubblicazione: (2025)
Addendum: Systematic Evaluation of Randomized Cache Designs against Cache Occupancy
di: Chakraborty, Anirban, et al.
Pubblicazione: (2025)
di: Chakraborty, Anirban, et al.
Pubblicazione: (2025)
Toward Efficient Inference Attacks: Shadow Model Sharing via Mixture-of-Experts
di: Bai, Li, et al.
Pubblicazione: (2025)
di: Bai, Li, et al.
Pubblicazione: (2025)
CipherPrune: Efficient and Scalable Private Transformer Inference
di: Zhang, Yancheng, et al.
Pubblicazione: (2025)
di: Zhang, Yancheng, et al.
Pubblicazione: (2025)
A First Look At Efficient And Secure On-Device LLM Inference Against KV Leakage
di: Yang, Huan, et al.
Pubblicazione: (2024)
di: Yang, Huan, et al.
Pubblicazione: (2024)
From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching
di: Zhang, Zhixiang, et al.
Pubblicazione: (2026)
di: Zhang, Zhixiang, et al.
Pubblicazione: (2026)
Towards Privacy-Preserving LLM Inference via Covariant Obfuscation (Technical Report)
di: Lin, Yu, et al.
Pubblicazione: (2026)
di: Lin, Yu, et al.
Pubblicazione: (2026)
Smart Privacy Policy Assistant: An LLM-Powered System for Transparent and Actionable Privacy Notices
di: Kalvakuntla, Sriharshini, et al.
Pubblicazione: (2026)
di: Kalvakuntla, Sriharshini, et al.
Pubblicazione: (2026)
Unraveling Responsiveness of Chained BFT Consensus with Network Delay
di: Tang, Yining, et al.
Pubblicazione: (2025)
di: Tang, Yining, et al.
Pubblicazione: (2025)
OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services
di: Wang, Longxiang, et al.
Pubblicazione: (2026)
di: Wang, Longxiang, et al.
Pubblicazione: (2026)
Hidden Web Caches Discovery
di: Golinelli, Matteo, et al.
Pubblicazione: (2024)
di: Golinelli, Matteo, et al.
Pubblicazione: (2024)
A Near-Cache Architectural Framework for Cryptographic Computing
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
The Avatar Cache: Enabling On-Demand Security with Morphable Cache Architecture
di: Bhatla, Anubhav, et al.
Pubblicazione: (2026)
di: Bhatla, Anubhav, et al.
Pubblicazione: (2026)
Random and Safe Cache Architecture to Defeat Cache Timing Attacks
di: Hu, Guangyuan, et al.
Pubblicazione: (2023)
di: Hu, Guangyuan, et al.
Pubblicazione: (2023)
Systematic Evaluation of Randomized Cache Designs against Cache Occupancy
di: Chakraborty, Anirban, et al.
Pubblicazione: (2023)
di: Chakraborty, Anirban, et al.
Pubblicazione: (2023)
CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs
di: Fahey, Ryan
Pubblicazione: (2026)
di: Fahey, Ryan
Pubblicazione: (2026)
Write+Sync: Software Cache Write Covert Channels Exploiting Memory-disk Synchronization
di: Chen, Congcong, et al.
Pubblicazione: (2023)
di: Chen, Congcong, et al.
Pubblicazione: (2023)
A Survey on Privacy-Preserving Caching at Network Edge: Classification, Solutions, and Challenges
di: Zhang, Xianzhi, et al.
Pubblicazione: (2024)
di: Zhang, Xianzhi, et al.
Pubblicazione: (2024)
Efficient RL-based Cache Vulnerability Exploration by Penalizing Useless Agent Actions
di: Nakanishi, Kanato, et al.
Pubblicazione: (2025)
di: Nakanishi, Kanato, et al.
Pubblicazione: (2025)
PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
Exposing LLM User Privacy via Traffic Fingerprint Analysis: A Study of Privacy Risks in LLM Agent Interactions
di: Zhang, Yixiang, et al.
Pubblicazione: (2025)
di: Zhang, Yixiang, et al.
Pubblicazione: (2025)
FACOS: Enabling Privacy Protection Through Fine-Grained Access Control with On-chain and Off-chain System
di: Liu, Chao, et al.
Pubblicazione: (2024)
di: Liu, Chao, et al.
Pubblicazione: (2024)
RollingCache: Using Runtime Behavior to Defend Against Cache Side Channel Attacks
di: Ojha, Divya, et al.
Pubblicazione: (2024)
di: Ojha, Divya, et al.
Pubblicazione: (2024)
Attacks on Approximate Caches in Text-to-Image Diffusion Models
di: Sun, Desen, et al.
Pubblicazione: (2025)
di: Sun, Desen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
di: Wang, Rui, et al.
Pubblicazione: (2025) -
NetEcho: From Real-World Streaming Side-Channels to Full LLM Conversation Recovery
di: Zhang, Zheng, et al.
Pubblicazione: (2025) -
Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference
di: Chu, Kexin, et al.
Pubblicazione: (2025) -
MPCache: MPC-Friendly KV Cache Eviction for Efficient Private LLM Inference
di: Zeng, Wenxuan, et al.
Pubblicazione: (2025) -
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
di: Luo, Zhifan, et al.
Pubblicazione: (2025)