HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Jun, Wang, Jue, Li, Huan, Shou, Lidan, Chen, Ke, Chen, Gang, Xie, Qin, Xie, Guiming, Gong, Xuejian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
von: Zhang, Jun, et al.
Veröffentlicht: (2023)
von: Zhang, Jun, et al.
Veröffentlicht: (2023)
Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
von: Zhang, Jun, et al.
Veröffentlicht: (2026)
von: Zhang, Jun, et al.
Veröffentlicht: (2026)
See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
von: Ji, Yicheng, et al.
Veröffentlicht: (2026)
von: Ji, Yicheng, et al.
Veröffentlicht: (2026)
KcMF: A Knowledge-compliant Framework for Schema and Entity Matching with Fine-tuning-free LLMs
von: Xu, Yongqin, et al.
Veröffentlicht: (2024)
von: Xu, Yongqin, et al.
Veröffentlicht: (2024)
CHASe: Client Heterogeneity-Aware Data Selection for Effective Federated Active Learning
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
von: Xiao, Sibo, et al.
Veröffentlicht: (2025)
von: Xiao, Sibo, et al.
Veröffentlicht: (2025)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
von: Zeng, Bowen, et al.
Veröffentlicht: (2026)
von: Zeng, Bowen, et al.
Veröffentlicht: (2026)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
von: Ji, Yicheng, et al.
Veröffentlicht: (2025)
von: Ji, Yicheng, et al.
Veröffentlicht: (2025)
NLCTables: A Dataset for Marrying Natural Language Conditions with Table Discovery
von: Cui, Lingxi, et al.
Veröffentlicht: (2025)
von: Cui, Lingxi, et al.
Veröffentlicht: (2025)
CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion Recognition
von: Peng, Cheng, et al.
Veröffentlicht: (2023)
von: Peng, Cheng, et al.
Veröffentlicht: (2023)
FloE: On-the-Fly MoE Inference on Memory-constrained GPU
von: Zhou, Yuxin, et al.
Veröffentlicht: (2025)
von: Zhou, Yuxin, et al.
Veröffentlicht: (2025)
Tabular Data Augmentation for Machine Learning: Progress and Prospects of Embracing Generative AI
von: Cui, Lingxi, et al.
Veröffentlicht: (2024)
von: Cui, Lingxi, et al.
Veröffentlicht: (2024)
KVShare: An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse
von: Yang, Huan, et al.
Veröffentlicht: (2025)
von: Yang, Huan, et al.
Veröffentlicht: (2025)
Empowering ChatGPT-Like Large-Scale Language Models with Local Knowledge Base for Industrial Prognostics and Health Management
von: Wang, Huan, et al.
Veröffentlicht: (2023)
von: Wang, Huan, et al.
Veröffentlicht: (2023)
TableCopilot: A Table Assistant Empowered by Natural Language Conditional Table Discovery
von: Cui, Lingxi, et al.
Veröffentlicht: (2025)
von: Cui, Lingxi, et al.
Veröffentlicht: (2025)
Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference
von: Chen, Zhuo, et al.
Veröffentlicht: (2025)
von: Chen, Zhuo, et al.
Veröffentlicht: (2025)
Multilingual Knowledge Graph Completion from Pretrained Language Models with Knowledge Constraints
von: Song, Ran, et al.
Veröffentlicht: (2024)
von: Song, Ran, et al.
Veröffentlicht: (2024)
RedParrot: Accelerating NL-to-DSL for Business Analytics via Query Semantic Caching
von: Wang, Tong, et al.
Veröffentlicht: (2026)
von: Wang, Tong, et al.
Veröffentlicht: (2026)
Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
von: Bayazit, Deniz, et al.
Veröffentlicht: (2023)
von: Bayazit, Deniz, et al.
Veröffentlicht: (2023)
Multi-Hierarchical Feature Detection for Large Language Model Generated Text
von: Zhang, Luyan, et al.
Veröffentlicht: (2025)
von: Zhang, Luyan, et al.
Veröffentlicht: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
von: Zhao, Bowen, et al.
Veröffentlicht: (2024)
von: Zhao, Bowen, et al.
Veröffentlicht: (2024)
Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks
von: Shen, Chen, et al.
Veröffentlicht: (2026)
von: Shen, Chen, et al.
Veröffentlicht: (2026)
Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning
von: Xie, Wanyun, et al.
Veröffentlicht: (2025)
von: Xie, Wanyun, et al.
Veröffentlicht: (2025)
Knowledge of Pretrained Language Models on Surface Information of Tokens
von: Hiraoka, Tatsuya, et al.
Veröffentlicht: (2024)
von: Hiraoka, Tatsuya, et al.
Veröffentlicht: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
von: Liang, Cheng, et al.
Veröffentlicht: (2026)
von: Liang, Cheng, et al.
Veröffentlicht: (2026)
Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration
von: Bai, Tianyi, et al.
Veröffentlicht: (2024)
von: Bai, Tianyi, et al.
Veröffentlicht: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
von: Huang, Yukun, et al.
Veröffentlicht: (2025)
von: Huang, Yukun, et al.
Veröffentlicht: (2025)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
von: Ma, Xuezhe, et al.
Veröffentlicht: (2024)
von: Ma, Xuezhe, et al.
Veröffentlicht: (2024)
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
von: Chen, Bo-Wei, et al.
Veröffentlicht: (2026)
von: Chen, Bo-Wei, et al.
Veröffentlicht: (2026)
Progressive Residual Warmup for Language Model Pretraining
von: Chen, Tianhao, et al.
Veröffentlicht: (2026)
von: Chen, Tianhao, et al.
Veröffentlicht: (2026)
A Comprehensive Study of Shapley Value in Data Analytics
von: Lin, Hong, et al.
Veröffentlicht: (2024)
von: Lin, Hong, et al.
Veröffentlicht: (2024)
SVFusion: A CPU-GPU Co-Processing Architecture for Large-Scale Real-Time Vector Search
von: Peng, Yuchen, et al.
Veröffentlicht: (2026)
von: Peng, Yuchen, et al.
Veröffentlicht: (2026)
Improving Non-autoregressive Translation Quality with Pretrained Language Model, Embedding Distillation and Upsampling Strategy for CTC
von: Syu, Shen-sian, et al.
Veröffentlicht: (2023)
von: Syu, Shen-sian, et al.
Veröffentlicht: (2023)
CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs
von: Lv, Junlin, et al.
Veröffentlicht: (2024)
von: Lv, Junlin, et al.
Veröffentlicht: (2024)
Multimodal Dialog Systems with Dual Knowledge-enhanced Generative Pretrained Language Model
von: Chen, Xiaolin, et al.
Veröffentlicht: (2022)
von: Chen, Xiaolin, et al.
Veröffentlicht: (2022)
FL-GUARD: A Holistic Framework for Run-Time Detection and Recovery of Negative Federated Learning
von: Lin, Hong, et al.
Veröffentlicht: (2024)
von: Lin, Hong, et al.
Veröffentlicht: (2024)
A Component-Based Survey of Interactions between Large Language Models and Multi-Armed Bandits
von: Chen, Siguang, et al.
Veröffentlicht: (2026)
von: Chen, Siguang, et al.
Veröffentlicht: (2026)
Contextualization Distillation from Large Language Model for Knowledge Graph Completion
von: Li, Dawei, et al.
Veröffentlicht: (2024)
von: Li, Dawei, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
von: Zhang, Jun, et al.
Veröffentlicht: (2025) -
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
von: Zhang, Jun, et al.
Veröffentlicht: (2023) -
Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
von: Zhang, Jun, et al.
Veröffentlicht: (2026) -
See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
von: Ji, Yicheng, et al.
Veröffentlicht: (2026) -
KcMF: A Knowledge-compliant Framework for Schema and Entity Matching with Fine-tuning-free LLMs
von: Xu, Yongqin, et al.
Veröffentlicht: (2024)