CORM: Cache Optimization with Recent Message for Large Language Model Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dai, Jincheng, Huang, Zhuowei, Jiang, Haiyun, Chen, Chen, Cai, Deng, Bi, Wei, Shi, Shuming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
par: Zhang, Yue, et autres
Publié: (2023)
par: Zhang, Yue, et autres
Publié: (2023)
StrategyLLM: Large Language Models as Strategy Generators, Executors, Optimizers, and Evaluators for Problem Solving
par: Gao, Chang, et autres
Publié: (2023)
par: Gao, Chang, et autres
Publié: (2023)
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
par: Wu, Huyu, et autres
Publié: (2025)
par: Wu, Huyu, et autres
Publié: (2025)
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
par: Zhang, Yue, et autres
Publié: (2023)
par: Zhang, Yue, et autres
Publié: (2023)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
par: Liu, Zhiyuan, et autres
Publié: (2025)
par: Liu, Zhiyuan, et autres
Publié: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
Recent Advancement of Emotion Cognition in Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Towards Privacy-Preserving Machine Translation at the Inference Stage: A New Task and Benchmark
par: Shao, Wei, et autres
Publié: (2026)
par: Shao, Wei, et autres
Publié: (2026)
Model Compression and Efficient Inference for Large Language Models: A Survey
par: Wang, Wenxiao, et autres
Publié: (2024)
par: Wang, Wenxiao, et autres
Publié: (2024)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
par: Ding, Jiayu, et autres
Publié: (2025)
par: Ding, Jiayu, et autres
Publié: (2025)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
Is the System Message Really Important to Jailbreaks in Large Language Models?
par: Zou, Xiaotian, et autres
Publié: (2024)
par: Zou, Xiaotian, et autres
Publié: (2024)
Optimizing Large Language Models for Detecting Symptoms of Comorbid Depression or Anxiety in Chronic Diseases: Insights from Patient Messages
par: Kim, Jiyeong, et autres
Publié: (2025)
par: Kim, Jiyeong, et autres
Publié: (2025)
ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
par: Zhang, Qing, et autres
Publié: (2025)
par: Zhang, Qing, et autres
Publié: (2025)
Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax Reduction
par: Fu, Tingchen, et autres
Publié: (2024)
par: Fu, Tingchen, et autres
Publié: (2024)
From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation
par: Wang, Jiahao, et autres
Publié: (2026)
par: Wang, Jiahao, et autres
Publié: (2026)
Knowledge Fusion of Large Language Models
par: Wan, Fanqi, et autres
Publié: (2024)
par: Wan, Fanqi, et autres
Publié: (2024)
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
par: Wen, Yuchen, et autres
Publié: (2024)
par: Wen, Yuchen, et autres
Publié: (2024)
Prompt and Parameter Co-Optimization for Large Language Models
par: Bo, Xiaohe, et autres
Publié: (2025)
par: Bo, Xiaohe, et autres
Publié: (2025)
Spotting AI's Touch: Identifying LLM-Paraphrased Spans in Text
par: Li, Yafu, et autres
Publié: (2024)
par: Li, Yafu, et autres
Publié: (2024)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
par: Shi, Dachuan, et autres
Publié: (2025)
par: Shi, Dachuan, et autres
Publié: (2025)
Large Language Models Are Neurosymbolic Reasoners
par: Fang, Meng, et autres
Publié: (2024)
par: Fang, Meng, et autres
Publié: (2024)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
FactAlign: Long-form Factuality Alignment of Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models
par: Yu, Longhui, et autres
Publié: (2023)
par: Yu, Longhui, et autres
Publié: (2023)
MAPO: Boosting Large Language Model Performance with Model-Adaptive Prompt Optimization
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
ToMBench: Benchmarking Theory of Mind in Large Language Models
par: Chen, Zhuang, et autres
Publié: (2024)
par: Chen, Zhuang, et autres
Publié: (2024)
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
par: Gim, In, et autres
Publié: (2023)
par: Gim, In, et autres
Publié: (2023)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)
par: Liu, Akide, et autres
Publié: (2024)
POPI: Personalizing LLMs via Optimized Natural Language Preference Inference
par: Chen, Yizhuo, et autres
Publié: (2025)
par: Chen, Yizhuo, et autres
Publié: (2025)
A Survey on Efficient Inference for Large Language Models
par: Zhou, Zixuan, et autres
Publié: (2024)
par: Zhou, Zixuan, et autres
Publié: (2024)
Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
par: Xiong, Chen, et autres
Publié: (2025)
par: Xiong, Chen, et autres
Publié: (2025)
Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models
par: Mahmud, Saaduddin, et autres
Publié: (2025)
par: Mahmud, Saaduddin, et autres
Publié: (2025)
The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models
par: Huang, Linghan, et autres
Publié: (2025)
par: Huang, Linghan, et autres
Publié: (2025)
XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
par: Monteiro, João, et autres
Publié: (2024)
par: Monteiro, João, et autres
Publié: (2024)
QOG:Question and Options Generation based on Language Model
par: Zhou, Jincheng
Publié: (2024)
par: Zhou, Jincheng
Publié: (2024)
Large Language Models and Causal Inference in Collaboration: A Survey
par: Liu, Xiaoyu, et autres
Publié: (2024)
par: Liu, Xiaoyu, et autres
Publié: (2024)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
par: Zhang, Tunyu, et autres
Publié: (2025)
par: Zhang, Tunyu, et autres
Publié: (2025)
On the Worst Prompt Performance of Large Language Models
par: Cao, Bowen, et autres
Publié: (2024)
par: Cao, Bowen, et autres
Publié: (2024)
How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding
par: Chen, Wei, et autres
Publié: (2026)
par: Chen, Wei, et autres
Publié: (2026)
Documents similaires
-
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
par: Zhang, Yue, et autres
Publié: (2023) -
StrategyLLM: Large Language Models as Strategy Generators, Executors, Optimizers, and Evaluators for Problem Solving
par: Gao, Chang, et autres
Publié: (2023) -
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
par: Wu, Huyu, et autres
Publié: (2025) -
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
par: Zhang, Yue, et autres
Publié: (2023) -
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
par: Liu, Zhiyuan, et autres
Publié: (2025)