Krul: Efficient State Restoration for Multi-turn Conversations with Dynamic Cross-layer KV Sharing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wen, Junyi, Liang, Junyuan, Hong, Zicong, Chen, Wuhui, Cai, Ting, Zheng, Zibin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
par: Fang, Zhiyuan, et autres
Publié: (2025)
par: Fang, Zhiyuan, et autres
Publié: (2025)
Fate: Fast Edge Inference of Mixture-of-Experts Models via Cross-Layer Gate
par: Fang, Zhiyuan, et autres
Publié: (2025)
par: Fang, Zhiyuan, et autres
Publié: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2024)
par: Wu, You, et autres
Publié: (2024)
Reconstructing KV Caches with Cross-layer Fusion For Enhanced Transformers
par: Lin, Hongzhan, et autres
Publié: (2025)
par: Lin, Hongzhan, et autres
Publié: (2025)
KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference
par: Lin, Jian, et autres
Publié: (2026)
par: Lin, Jian, et autres
Publié: (2026)
Broaden your SCOPE! Efficient Multi-turn Conversation Planning for LLMs with Semantic Space
par: Chen, Zhiliang, et autres
Publié: (2025)
par: Chen, Zhiliang, et autres
Publié: (2025)
SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation
par: Cheng, Yiruo, et autres
Publié: (2024)
par: Cheng, Yiruo, et autres
Publié: (2024)
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
par: Cai, Dexian, et autres
Publié: (2025)
par: Cai, Dexian, et autres
Publié: (2025)
FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs
par: Zhu, Han, et autres
Publié: (2026)
par: Zhu, Han, et autres
Publié: (2026)
Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention
par: Gao, Bin, et autres
Publié: (2024)
par: Gao, Bin, et autres
Publié: (2024)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
par: Fan, Zhiting, et autres
Publié: (2024)
par: Fan, Zhiting, et autres
Publié: (2024)
On the Multi-turn Instruction Following for Conversational Web Agents
par: Deng, Yang, et autres
Publié: (2024)
par: Deng, Yang, et autres
Publié: (2024)
Beyond KV Caching: Shared Attention for Efficient LLMs
par: Liao, Bingli, et autres
Publié: (2024)
par: Liao, Bingli, et autres
Publié: (2024)
DroidSpeak: KV Cache Sharing for Cross-LLM Communication and Multi-LLM Serving
par: Liu, Yuhan, et autres
Publié: (2024)
par: Liu, Yuhan, et autres
Publié: (2024)
GriDB: Scaling Blockchain Database via Sharding and Off-Chain Cross-Shard Mechanism
par: Hong, Zicong, et autres
Publié: (2024)
par: Hong, Zicong, et autres
Publié: (2024)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies
par: Song, Jingze, et autres
Publié: (2026)
par: Song, Jingze, et autres
Publié: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
DyMoE: Dynamic Expert Orchestration with Mixed-Precision Quantization for Efficient MoE Inference on Edge
par: Huang, Yuegui, et autres
Publié: (2026)
par: Huang, Yuegui, et autres
Publié: (2026)
Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database Exploration
par: Sun, Linzhuang, et autres
Publié: (2025)
par: Sun, Linzhuang, et autres
Publié: (2025)
A State-Update Prompting Strategy for Efficient and Robust Multi-turn Dialogue
par: Liu, Ziyi
Publié: (2025)
par: Liu, Ziyi
Publié: (2025)
Training and Serving System of Foundation Models: A Comprehensive Survey
par: Zhou, Jiahang, et autres
Publié: (2024)
par: Zhou, Jiahang, et autres
Publié: (2024)
NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation
par: Wang, Xiaoyang, et autres
Publié: (2021)
par: Wang, Xiaoyang, et autres
Publié: (2021)
Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model
par: Niu, Fuqiang, et autres
Publié: (2024)
par: Niu, Fuqiang, et autres
Publié: (2024)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
par: Chen, Han, et autres
Publié: (2025)
par: Chen, Han, et autres
Publié: (2025)
Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training
par: Chen, Maximillian, et autres
Publié: (2024)
par: Chen, Maximillian, et autres
Publié: (2024)
Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction
par: Hafez, Wael, et autres
Publié: (2026)
par: Hafez, Wael, et autres
Publié: (2026)
SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching
par: Zhao, Xinye, et autres
Publié: (2025)
par: Zhao, Xinye, et autres
Publié: (2025)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
par: Dong, Zican, et autres
Publié: (2026)
par: Dong, Zican, et autres
Publié: (2026)
MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
par: Zhu, Han, et autres
Publié: (2025)
par: Zhu, Han, et autres
Publié: (2025)
Source-primed Multi-turn Conversation Helps Large Language Models Translate Documents
par: Hu, Hanxu, et autres
Publié: (2025)
par: Hu, Hanxu, et autres
Publié: (2025)
PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference
par: Patel, Ishan, et autres
Publié: (2026)
par: Patel, Ishan, et autres
Publié: (2026)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
par: Tong, Terry, et autres
Publié: (2024)
par: Tong, Terry, et autres
Publié: (2024)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
LabelCoRank: Revolutionizing Long Tail Multi-Label Classification with Co-Occurrence Reranking
par: Yan, Yan, et autres
Publié: (2025)
par: Yan, Yan, et autres
Publié: (2025)
Documents similaires
-
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
par: Fang, Zhiyuan, et autres
Publié: (2025) -
Fate: Fast Edge Inference of Mixture-of-Experts Models via Cross-Layer Gate
par: Fang, Zhiyuan, et autres
Publié: (2025) -
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025) -
A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference
par: Wu, You, et autres
Publié: (2024) -
Reconstructing KV Caches with Cross-layer Fusion For Enhanced Transformers
par: Lin, Hongzhan, et autres
Publié: (2025)