IAM: Efficient Inference through Attention Mapping between Different-scale LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yi, Li, Zuchao, Zhao, Hai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
par: Qiu, Quantong, et autres
Publié: (2026)
par: Qiu, Quantong, et autres
Publié: (2026)
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
par: Song, Weixi, et autres
Publié: (2023)
par: Song, Weixi, et autres
Publié: (2023)
Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps
par: Waldendorf, Jonas, et autres
Publié: (2026)
par: Waldendorf, Jonas, et autres
Publié: (2026)
DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt Compression
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
CHAI: Clustered Head Attention for Efficient LLM Inference
par: Agarwal, Saurabh, et autres
Publié: (2024)
par: Agarwal, Saurabh, et autres
Publié: (2024)
AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs
par: S, Santhosh G, et autres
Publié: (2025)
par: S, Santhosh G, et autres
Publié: (2025)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
GKT: A Novel Guidance-Based Knowledge Transfer Framework For Efficient Cloud-edge Collaboration LLM Deployment
par: Yao, Yao, et autres
Publié: (2024)
par: Yao, Yao, et autres
Publié: (2024)
Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination Mitigation
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs
par: Souibgui, Mohamed Ali, et autres
Publié: (2026)
par: Souibgui, Mohamed Ali, et autres
Publié: (2026)
Quantifying the Impact of Structured Output Format on Large Language Models through Causal Inference
par: Yuan, Han, et autres
Publié: (2025)
par: Yuan, Han, et autres
Publié: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
par: Jo, Dongwon, et autres
Publié: (2026)
par: Jo, Dongwon, et autres
Publié: (2026)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Hallucination Detection in LLMs Using Spectral Features of Attention Maps
par: Binkowski, Jakub, et autres
Publié: (2025)
par: Binkowski, Jakub, et autres
Publié: (2025)
Tell Your Model Where to Attend: Post-hoc Attention Steering for LLMs
par: Zhang, Qingru, et autres
Publié: (2023)
par: Zhang, Qingru, et autres
Publié: (2023)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
par: Tang, Hongyin, et autres
Publié: (2024)
par: Tang, Hongyin, et autres
Publié: (2024)
Multipole Attention for Efficient Long Context Reasoning
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
par: Tang, Jiaming, et autres
Publié: (2024)
par: Tang, Jiaming, et autres
Publié: (2024)
FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference
par: Lai, Xunhao, et autres
Publié: (2025)
par: Lai, Xunhao, et autres
Publié: (2025)
Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization
par: Zeng, Yongcheng, et autres
Publié: (2025)
par: Zeng, Yongcheng, et autres
Publié: (2025)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
par: Song, Dinghong, et autres
Publié: (2025)
par: Song, Dinghong, et autres
Publié: (2025)
Why Softmax Attention Outperforms Linear Attention
par: Deng, Yichuan, et autres
Publié: (2023)
par: Deng, Yichuan, et autres
Publié: (2023)
Beyond KV Caching: Shared Attention for Efficient LLMs
par: Liao, Bingli, et autres
Publié: (2024)
par: Liao, Bingli, et autres
Publié: (2024)
Star Attention: Efficient LLM Inference over Long Sequences
par: Acharya, Shantanu, et autres
Publié: (2024)
par: Acharya, Shantanu, et autres
Publié: (2024)
Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models
par: Yao, Yao, et autres
Publié: (2023)
par: Yao, Yao, et autres
Publié: (2023)
SirLLM: Streaming Infinite Retentive LLM
par: Yao, Yao, et autres
Publié: (2024)
par: Yao, Yao, et autres
Publié: (2024)
DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference
par: Ye, Jiancai, et autres
Publié: (2026)
par: Ye, Jiancai, et autres
Publié: (2026)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
Training-Inference Consistent Segmented Execution for Long-Context LLMs
par: Shang, Xianpeng, et autres
Publié: (2026)
par: Shang, Xianpeng, et autres
Publié: (2026)
The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
par: Nawrot, Piotr, et autres
Publié: (2025)
par: Nawrot, Piotr, et autres
Publié: (2025)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
par: Liu, Runze, et autres
Publié: (2025)
par: Liu, Runze, et autres
Publié: (2025)
S$^3$-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference
par: Ma, Qingsen, et autres
Publié: (2026)
par: Ma, Qingsen, et autres
Publié: (2026)
RoseRAG: Robust Retrieval-augmented Generation with Small-scale LLMs via Margin-aware Preference Optimization
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
Comparative Analysis of Different Efficient Fine Tuning Methods of Large Language Models (LLMs) in Low-Resource Setting
par: Srinivasan, Krishna Prasad Varadarajan, et autres
Publié: (2024)
par: Srinivasan, Krishna Prasad Varadarajan, et autres
Publié: (2024)
Training Tensor Attention Efficiently: From Cubic to Almost Linear Time
par: Cao, Yang, et autres
Publié: (2024)
par: Cao, Yang, et autres
Publié: (2024)
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition
par: Ye, Lu, et autres
Publié: (2024)
par: Ye, Lu, et autres
Publié: (2024)
Documents similaires
-
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
par: Qiu, Quantong, et autres
Publié: (2026) -
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025) -
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
par: Song, Weixi, et autres
Publié: (2023) -
Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps
par: Waldendorf, Jonas, et autres
Publié: (2026) -
DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt Compression
par: Zhao, Yi, et autres
Publié: (2025)