MPCache: MPC-Friendly KV Cache Eviction for Efficient Private LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Wenxuan, Dong, Ye, Zhou, Jinjin, Tan, Jin, Wang, Lei, Wei, Tao, Wang, Runsheng, Li, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EQO: Exploring Ultra-Efficient Private Inference with Winograd-Based Protocol and Quantization Co-Optimization
par: Zeng, Wenxuan, et autres
Publié: (2024)
par: Zeng, Wenxuan, et autres
Publié: (2024)
PrivQuant: Communication-Efficient Private Inference with Quantized Network/Protocol Co-Optimization
par: Xu, Tianshi, et autres
Publié: (2024)
par: Xu, Tianshi, et autres
Publié: (2024)
Breaking the Layer Barrier: Remodeling Private Transformer Inference with Hybrid CKKS and MPC
par: Xu, Tianshi, et autres
Publié: (2025)
par: Xu, Tianshi, et autres
Publié: (2025)
CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
par: Wu, Guanlong, et autres
Publié: (2026)
par: Wu, Guanlong, et autres
Publié: (2026)
HEQuant: Marrying Homomorphic Encryption and Quantization for Communication-Efficient Private Inference
par: Xu, Tianshi, et autres
Publié: (2024)
par: Xu, Tianshi, et autres
Publié: (2024)
PrivCirNet: Efficient Private Inference via Block Circulant Transformation
par: Xu, Tianshi, et autres
Publié: (2024)
par: Xu, Tianshi, et autres
Publié: (2024)
Cachemir: Fully Homomorphic Encrypted Inference of Generative Large Language Model with KV Cache
par: Yu, Ye, et autres
Publié: (2026)
par: Yu, Ye, et autres
Publié: (2026)
PRIVMARK: Private Large Language Models Watermarking with MPC
par: Fargues, Thomas, et autres
Publié: (2025)
par: Fargues, Thomas, et autres
Publié: (2025)
UFO: Unlocking Ultra-Efficient Quantized Private Inference with Protocol and Algorithm Co-Optimization
par: Zeng, Wenxuan, et autres
Publié: (2026)
par: Zeng, Wenxuan, et autres
Publié: (2026)
FastQuery: Communication-efficient Embedding Table Query for Private LLM Inference
par: Lin, Chenqi, et autres
Publié: (2024)
par: Lin, Chenqi, et autres
Publié: (2024)
BackCache: Mitigating Contention-Based Cache Timing Attacks by Hiding Cache Line Evictions
par: Wang, Quancheng, et autres
Publié: (2023)
par: Wang, Quancheng, et autres
Publié: (2023)
GTree: GPU-Friendly Privacy-preserving Decision Tree Training and Inference
par: Wang, Qifan, et autres
Publié: (2023)
par: Wang, Qifan, et autres
Publié: (2023)
CryptPEFT: Efficient and Private Neural Network Inference via Parameter-Efficient Fine-Tuning
par: Xia, Saisai, et autres
Publié: (2025)
par: Xia, Saisai, et autres
Publié: (2025)
Ditto: Quantization-aware Secure Inference of Transformers upon MPC
par: Wu, Haoqi, et autres
Publié: (2024)
par: Wu, Haoqi, et autres
Publié: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
par: Jiang, Tanqiu, et autres
Publié: (2024)
par: Jiang, Tanqiu, et autres
Publié: (2024)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
par: Luo, Zhifan, et autres
Publié: (2025)
par: Luo, Zhifan, et autres
Publié: (2025)
LRD-MPC: Efficient MPC Inference through Low-rank Decomposition
par: Tang, Tingting, et autres
Publié: (2026)
par: Tang, Tingting, et autres
Publié: (2026)
Slice+Slice Baby: Generating Last-Level Cache Eviction Sets in the Blink of an Eye
par: Morgan, Bradley, et autres
Publié: (2025)
par: Morgan, Bradley, et autres
Publié: (2025)
Efficient and High-Accuracy Private CNN Inference with Helper-Assisted Malicious Security
par: Wang, Kaiwen, et autres
Publié: (2025)
par: Wang, Kaiwen, et autres
Publié: (2025)
Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference
par: Chu, Kexin, et autres
Publié: (2025)
par: Chu, Kexin, et autres
Publié: (2025)
CipherFormer: Efficient Transformer Private Inference with Low Round Complexity
par: Wang, Weize, et autres
Publié: (2024)
par: Wang, Weize, et autres
Publié: (2024)
CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
Blackbox Dataset Inference for LLM
par: Zhou, Ruikai, et autres
Publié: (2025)
par: Zhou, Ruikai, et autres
Publié: (2025)
CryptoGen: Secure Transformer Generation with Encrypted KV-Cache Reuse
par: Zhang, Hedong, et autres
Publié: (2026)
par: Zhang, Hedong, et autres
Publié: (2026)
Robust and Verifiable MPC with Applications to Linear Machine Learning Inference
par: Wang, Tzu-Shen, et autres
Publié: (2025)
par: Wang, Tzu-Shen, et autres
Publié: (2025)
A First Look At Efficient And Secure On-Device LLM Inference Against KV Leakage
par: Yang, Huan, et autres
Publié: (2024)
par: Yang, Huan, et autres
Publié: (2024)
MPC-Pipe: an Efficient Pipeline Scheme for Secure Multi-party Machine Learning Inference
par: Wang, Yongqin, et autres
Publié: (2022)
par: Wang, Yongqin, et autres
Publié: (2022)
MPC-Minimized Secure LLM Inference
par: Rathee, Deevashwer, et autres
Publié: (2024)
par: Rathee, Deevashwer, et autres
Publié: (2024)
Towards Efficient Privacy-Preserving Machine Learning: A Systematic Review from Protocol, Model, and System Perspectives
par: Zeng, Wenxuan, et autres
Publié: (2025)
par: Zeng, Wenxuan, et autres
Publié: (2025)
CipherPrune: Efficient and Scalable Private Transformer Inference
par: Zhang, Yancheng, et autres
Publié: (2025)
par: Zhang, Yancheng, et autres
Publié: (2025)
KV-Auditor: Auditing Local Differential Privacy for Correlated Key-Value Estimation
par: Xu, Jingnan, et autres
Publié: (2025)
par: Xu, Jingnan, et autres
Publié: (2025)
A Survey on Private Transformer Inference
par: Li, Yang, et autres
Publié: (2024)
par: Li, Yang, et autres
Publié: (2024)
A Failure-Free and Efficient Discrete Laplace Distribution for Differential Privacy in MPC
par: Tjuawinata, Ivan, et autres
Publié: (2025)
par: Tjuawinata, Ivan, et autres
Publié: (2025)
MPC-EVM: Enabling MPC Execution by Smart Contracts In An Asynchronous Manner
par: Zhou, Yichen, et autres
Publié: (2025)
par: Zhou, Yichen, et autres
Publié: (2025)
DeepReShape: Redesigning Neural Networks for Efficient Private Inference
par: Jha, Nandan Kumar, et autres
Publié: (2023)
par: Jha, Nandan Kumar, et autres
Publié: (2023)
Large-Scale MPC: Scaling Private Iris Code Uniqueness Checks to Millions of Users
par: Bloemen, Remco, et autres
Publié: (2024)
par: Bloemen, Remco, et autres
Publié: (2024)
Whose Narrative is it Anyway? A KV Cache Manipulation Attack
par: Ganesh, Mukkesh, et autres
Publié: (2025)
par: Ganesh, Mukkesh, et autres
Publié: (2025)
Bit-Flip Vulnerability of Shared KV-Cache Blocks in LLM Serving Systems
par: Yamamoto, Yuji, et autres
Publié: (2026)
par: Yamamoto, Yuji, et autres
Publié: (2026)
Cascade: Token-Sharded Private LLM Inference
par: Thomas, Rahul, et autres
Publié: (2025)
par: Thomas, Rahul, et autres
Publié: (2025)
Private Transformer Inference in MLaaS: A Survey
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
Documents similaires
-
EQO: Exploring Ultra-Efficient Private Inference with Winograd-Based Protocol and Quantization Co-Optimization
par: Zeng, Wenxuan, et autres
Publié: (2024) -
PrivQuant: Communication-Efficient Private Inference with Quantized Network/Protocol Co-Optimization
par: Xu, Tianshi, et autres
Publié: (2024) -
Breaking the Layer Barrier: Remodeling Private Transformer Inference with Hybrid CKKS and MPC
par: Xu, Tianshi, et autres
Publié: (2025) -
CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
par: Wu, Guanlong, et autres
Publié: (2026) -
HEQuant: Marrying Homomorphic Encryption and Quantization for Communication-Efficient Private Inference
par: Xu, Tianshi, et autres
Publié: (2024)