Efficient Prompt Caching via Embedding Similarity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Hanlin, Zhu, Banghua, Jiao, Jiantao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
par: Zhu, Banghua, et autres
Publié: (2024)
par: Zhu, Banghua, et autres
Publié: (2024)
Generative AI Security: Challenges and Countermeasures
par: Zhu, Banghua, et autres
Publié: (2024)
par: Zhu, Banghua, et autres
Publié: (2024)
Towards Optimal Statistical Watermarking
par: Huang, Baihe, et autres
Publié: (2023)
par: Huang, Baihe, et autres
Publié: (2023)
Towards a Theoretical Understanding of the 'Reversal Curse' via Training Dynamics
par: Zhu, Hanlin, et autres
Publié: (2024)
par: Zhu, Hanlin, et autres
Publié: (2024)
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
par: Zhu, Banghua, et autres
Publié: (2023)
par: Zhu, Banghua, et autres
Publié: (2023)
Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers
par: Huang, Yixiao, et autres
Publié: (2025)
par: Huang, Yixiao, et autres
Publié: (2025)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
par: Su, DiJia, et autres
Publié: (2025)
par: Su, DiJia, et autres
Publié: (2025)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
par: Tang, Hanlin, et autres
Publié: (2024)
par: Tang, Hanlin, et autres
Publié: (2024)
vCache: Verified Semantic Prompt Caching
par: Schroeder, Luis Gaspar, et autres
Publié: (2025)
par: Schroeder, Luis Gaspar, et autres
Publié: (2025)
How to Evaluate Reward Models for RLHF
par: Frick, Evan, et autres
Publié: (2024)
par: Frick, Evan, et autres
Publié: (2024)
dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
par: Chen, Shirui, et autres
Publié: (2025)
par: Chen, Shirui, et autres
Publié: (2025)
Toward a Theory of Tokenization in LLMs
par: Rajaraman, Nived, et autres
Publié: (2024)
par: Rajaraman, Nived, et autres
Publié: (2024)
EmbedLLM: Learning Compact Representations of Large Language Models
par: Zhuang, Richard, et autres
Publié: (2024)
par: Zhuang, Richard, et autres
Publié: (2024)
Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question Answering
par: Hu, Zhanghao, et autres
Publié: (2025)
par: Hu, Zhanghao, et autres
Publié: (2025)
QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
par: Li, Zhikai, et autres
Publié: (2023)
par: Li, Zhikai, et autres
Publié: (2023)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
par: Zhu, Mingcheng, et autres
Publié: (2026)
par: Zhu, Mingcheng, et autres
Publié: (2026)
Advancing Semantic Caching for LLMs with Domain-Specific Embeddings and Synthetic Data
par: Gill, Waris, et autres
Publié: (2025)
par: Gill, Waris, et autres
Publié: (2025)
Position Information Emerges in Causal Transformers Without Positional Encodings via Similarity of Nearby Embeddings
par: Zuo, Chunsheng, et autres
Publié: (2024)
par: Zuo, Chunsheng, et autres
Publié: (2024)
Auditing Prompt Caching in Language Model APIs
par: Gu, Chenchen, et autres
Publié: (2025)
par: Gu, Chenchen, et autres
Publié: (2025)
An Analysis of Embedding Layers and Similarity Scores using Siamese Neural Networks
par: Bingi, Yash, et autres
Publié: (2023)
par: Bingi, Yash, et autres
Publié: (2023)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
par: Song, Dinghong, et autres
Publié: (2025)
par: Song, Dinghong, et autres
Publié: (2025)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
par: Su, Yi, et autres
Publié: (2026)
par: Su, Yi, et autres
Publié: (2026)
Large Language Model Unlearning via Embedding-Corrupted Prompts
par: Liu, Chris Yuhao, et autres
Publié: (2024)
par: Liu, Chris Yuhao, et autres
Publié: (2024)
Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control
par: Sedov, Sergey, et autres
Publié: (2024)
par: Sedov, Sergey, et autres
Publié: (2024)
LongEmbed: Extending Embedding Models for Long Context Retrieval
par: Zhu, Dawei, et autres
Publié: (2024)
par: Zhu, Dawei, et autres
Publié: (2024)
Can Embedding Similarity Predict Cross-Lingual Transfer? A Systematic Study on African Languages
par: Idris, Tewodros Kederalah, et autres
Publié: (2026)
par: Idris, Tewodros Kederalah, et autres
Publié: (2026)
From Exact Hits to Close Enough: Semantic Caching for LLM Embeddings
par: Biton, Dvir David, et autres
Publié: (2026)
par: Biton, Dvir David, et autres
Publié: (2026)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking
par: Federici, Marco, et autres
Publié: (2024)
par: Federici, Marco, et autres
Publié: (2024)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
par: Dialameh, Maryam, et autres
Publié: (2025)
par: Dialameh, Maryam, et autres
Publié: (2025)
In-context KV-Cache Eviction for LLMs via Attention-Gate
par: Zeng, Zihao, et autres
Publié: (2024)
par: Zeng, Zihao, et autres
Publié: (2024)
Nectar: Neural Estimation of Cached-Token Attention via Regression
par: Monteiro, João, et autres
Publié: (2026)
par: Monteiro, João, et autres
Publié: (2026)
Prompt Tuning for Natural Language to SQL with Embedding Fine-Tuning and RAG
par: Jang, Jisoo, et autres
Publié: (2025)
par: Jang, Jisoo, et autres
Publié: (2025)
Mitigate Negative Transfer with Similarity Heuristic Lifelong Prompt Tuning
par: Wu, Chenyuan, et autres
Publié: (2024)
par: Wu, Chenyuan, et autres
Publié: (2024)
LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization
par: Wu, Yuanchen, et autres
Publié: (2025)
par: Wu, Yuanchen, et autres
Publié: (2025)
Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention
par: Gao, Bin, et autres
Publié: (2024)
par: Gao, Bin, et autres
Publié: (2024)
PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration
par: Wu, Songhao, et autres
Publié: (2025)
par: Wu, Songhao, et autres
Publié: (2025)
Efficient RLVR Training via Weighted Mutual Information Data Selection
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
Documents similaires
-
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
par: Zhu, Banghua, et autres
Publié: (2024) -
Generative AI Security: Challenges and Countermeasures
par: Zhu, Banghua, et autres
Publié: (2024) -
Towards Optimal Statistical Watermarking
par: Huang, Baihe, et autres
Publié: (2023) -
Towards a Theoretical Understanding of the 'Reversal Curse' via Training Dynamics
par: Zhu, Hanlin, et autres
Publié: (2024) -
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
par: Zhu, Banghua, et autres
Publié: (2023)