Long-Context Attention Benchmark: From Kernel Efficiency to Distributed Context Parallelism
Fuente:
arXiv
Salvato in:
| Autori principali: | Bu, Tao, Wang, Qiangang, Zeng, Bowen, Sun, Hanwen, Huang, Yunpeng, Cao, Chun, Xu, Jingwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiCI: Hierarchical Construction-Integration for Long-Context Attention
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
di: Joshi, Thomas, et al.
Pubblicazione: (2025)
Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs
di: Zhu, Kan, et al.
Pubblicazione: (2025)
di: Zhu, Kan, et al.
Pubblicazione: (2025)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
Technical Debt in In-Context Learning: Diminishing Efficiency in Long Context
di: Joo, Taejong, et al.
Pubblicazione: (2025)
di: Joo, Taejong, et al.
Pubblicazione: (2025)
SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention
di: Xu, Hongtao, et al.
Pubblicazione: (2026)
di: Xu, Hongtao, et al.
Pubblicazione: (2026)
AcademicEval: Live Long-Context LLM Benchmark
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
Cost-Optimal Grouped-Query Attention for Long-Context Modeling
di: Chen, Yingfa, et al.
Pubblicazione: (2025)
di: Chen, Yingfa, et al.
Pubblicazione: (2025)
MoBA: Mixture of Block Attention for Long-Context LLMs
di: Lu, Enzhe, et al.
Pubblicazione: (2025)
di: Lu, Enzhe, et al.
Pubblicazione: (2025)
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
di: Zhou, Ruijie, et al.
Pubblicazione: (2026)
di: Zhou, Ruijie, et al.
Pubblicazione: (2026)
Benchmarking the Computational and Representational Efficiency of State Space Models against Transformers on Long-Context Dyadic Sessions
di: Koledoye, Abidemi, et al.
Pubblicazione: (2026)
di: Koledoye, Abidemi, et al.
Pubblicazione: (2026)
Benchmarking General-Purpose In-Context Learning
di: Wang, Fan, et al.
Pubblicazione: (2024)
di: Wang, Fan, et al.
Pubblicazione: (2024)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
di: Yang, Wang, et al.
Pubblicazione: (2025)
di: Yang, Wang, et al.
Pubblicazione: (2025)
MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning
di: Liu, Dong, et al.
Pubblicazione: (2026)
di: Liu, Dong, et al.
Pubblicazione: (2026)
Understanding In-Context Learning on Structured Manifolds: Bridging Attention to Kernel Methods
di: Shen, Zhaiming, et al.
Pubblicazione: (2025)
di: Shen, Zhaiming, et al.
Pubblicazione: (2025)
USP: A Unified Sequence Parallelism Approach for Long Context Generative AI
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
Attention in Constant Time: Vashista Sparse Attention for Long-Context Decoding with Exponential Guarantees
di: Nobaub, Vashista
Pubblicazione: (2026)
di: Nobaub, Vashista
Pubblicazione: (2026)
MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling
di: MiniCPM Team, et al.
Pubblicazione: (2026)
di: MiniCPM Team, et al.
Pubblicazione: (2026)
SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training
di: Li, Zhouyang, et al.
Pubblicazione: (2025)
di: Li, Zhouyang, et al.
Pubblicazione: (2025)
SEAL: Scaling to Emphasize Attention for Long-Context Retrieval
di: Lee, Changhun, et al.
Pubblicazione: (2025)
di: Lee, Changhun, et al.
Pubblicazione: (2025)
Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning
di: Ling Team, et al.
Pubblicazione: (2025)
di: Ling Team, et al.
Pubblicazione: (2025)
MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization
di: Hsieh, Cheng-Yu, et al.
Pubblicazione: (2024)
di: Hsieh, Cheng-Yu, et al.
Pubblicazione: (2024)
Revisiting In-Context Learning with Long Context Language Models
di: Baek, Jinheon, et al.
Pubblicazione: (2024)
di: Baek, Jinheon, et al.
Pubblicazione: (2024)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
di: Jin, Bowen, et al.
Pubblicazione: (2024)
di: Jin, Bowen, et al.
Pubblicazione: (2024)
LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
Long Context In-Context Compression by Getting to the Gist of Gisting
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
Double-P: Hierarchical Top-P Sparse Attention for Long-Context LLMs
di: Ni, Wentao, et al.
Pubblicazione: (2026)
di: Ni, Wentao, et al.
Pubblicazione: (2026)
VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling
di: Guanzhong, Chen
Pubblicazione: (2026)
di: Guanzhong, Chen
Pubblicazione: (2026)
Efficient Low Rank Attention for Long-Context Inference in Large Language Models
di: Li, Tenghui, et al.
Pubblicazione: (2025)
di: Li, Tenghui, et al.
Pubblicazione: (2025)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
di: Li, Zeju, et al.
Pubblicazione: (2026)
di: Li, Zeju, et al.
Pubblicazione: (2026)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
di: Xiao, Chaojun, et al.
Pubblicazione: (2024)
di: Xiao, Chaojun, et al.
Pubblicazione: (2024)
CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification
di: Xu, Jiacheng, et al.
Pubblicazione: (2025)
di: Xu, Jiacheng, et al.
Pubblicazione: (2025)
Scaling Context Requires Rethinking Attention
di: Gelada, Carles, et al.
Pubblicazione: (2025)
di: Gelada, Carles, et al.
Pubblicazione: (2025)
Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
di: Zhang, Yuchen, et al.
Pubblicazione: (2025)
di: Zhang, Yuchen, et al.
Pubblicazione: (2025)
Breaking the Context Bottleneck on Long Time Series Forecasting
di: Ma, Chao, et al.
Pubblicazione: (2024)
di: Ma, Chao, et al.
Pubblicazione: (2024)
Transformers Learn Robust In-Context Regression under Distributional Uncertainty
di: Cao, Hoang T. H., et al.
Pubblicazione: (2026)
di: Cao, Hoang T. H., et al.
Pubblicazione: (2026)
Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs
di: Song, Woomin, et al.
Pubblicazione: (2024)
di: Song, Woomin, et al.
Pubblicazione: (2024)
From Private to Public: Benchmarking GANs in the Context of Private Time Series Classification
di: Mercier, Dominique, et al.
Pubblicazione: (2023)
di: Mercier, Dominique, et al.
Pubblicazione: (2023)
Documenti analoghi
-
HiCI: Hierarchical Construction-Integration for Long-Context Attention
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026) -
Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference
di: Joshi, Thomas, et al.
Pubblicazione: (2025) -
Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs
di: Zhu, Kan, et al.
Pubblicazione: (2025) -
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
di: Yao, Feiyu, et al.
Pubblicazione: (2026) -
Technical Debt in In-Context Learning: Diminishing Efficiency in Long Context
di: Joo, Taejong, et al.
Pubblicazione: (2025)