FlashEVA: Accelerating LLM inference via Efficient Attention
Fuente:
arXiv
Guardado en:
| Autores principales: | Kostelec, Juan Gabriel, Guo, Qinghai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models
por: Kostelec, Juan Gabriel, et al.
Publicado: (2026)
por: Kostelec, Juan Gabriel, et al.
Publicado: (2026)
AllMem: A Memory-centric Recipe for Efficient Long-context Modeling
por: Wang, Ziming, et al.
Publicado: (2026)
por: Wang, Ziming, et al.
Publicado: (2026)
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
por: Sharma, Agniv, et al.
Publicado: (2024)
por: Sharma, Agniv, et al.
Publicado: (2024)
PLD+: Accelerating LLM inference by leveraging Language Model Artifacts
por: Somasundaram, Shwetha, et al.
Publicado: (2024)
por: Somasundaram, Shwetha, et al.
Publicado: (2024)
DeFT: Decoding with Flash Tree-attention for Efficient Tree-structured LLM Inference
por: Yao, Jinwei, et al.
Publicado: (2024)
por: Yao, Jinwei, et al.
Publicado: (2024)
Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
por: Zhang, Yong, et al.
Publicado: (2025)
por: Zhang, Yong, et al.
Publicado: (2025)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
por: Chen, Zhuokun, et al.
Publicado: (2026)
por: Chen, Zhuokun, et al.
Publicado: (2026)
Round Attention: A Novel Round-Level Attention Mechanism to Accelerate LLM Inference
por: Tang, Yaohua, et al.
Publicado: (2025)
por: Tang, Yaohua, et al.
Publicado: (2025)
FlashThink: An Early Exit Method For Efficient Reasoning
por: Jiang, Guochao, et al.
Publicado: (2025)
por: Jiang, Guochao, et al.
Publicado: (2025)
Quantum Transformer: Accelerating model inference via quantum linear algebra
por: Guo, Naixu, et al.
Publicado: (2024)
por: Guo, Naixu, et al.
Publicado: (2024)
LLM Inference Acceleration via Efficient Operation Fusion
por: Salmani, Mahsa, et al.
Publicado: (2025)
por: Salmani, Mahsa, et al.
Publicado: (2025)
JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency
por: Cai, Aichen, et al.
Publicado: (2026)
por: Cai, Aichen, et al.
Publicado: (2026)
OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference
por: Shin, Seungjun, et al.
Publicado: (2025)
por: Shin, Seungjun, et al.
Publicado: (2025)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
por: Lee, Younjoo, et al.
Publicado: (2026)
por: Lee, Younjoo, et al.
Publicado: (2026)
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
por: Zhang, Yaolun, et al.
Publicado: (2026)
por: Zhang, Yaolun, et al.
Publicado: (2026)
FlashSampling: Fast and Memory-Efficient Exact Sampling
por: Ruiz, Tomas, et al.
Publicado: (2026)
por: Ruiz, Tomas, et al.
Publicado: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
por: Ji, Haoxuan, et al.
Publicado: (2024)
por: Ji, Haoxuan, et al.
Publicado: (2024)
Two-dimensional early exit optimisation of LLM inference
por: Hůla, Jan, et al.
Publicado: (2026)
por: Hůla, Jan, et al.
Publicado: (2026)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention
por: Zhu, Qianchao, et al.
Publicado: (2024)
por: Zhu, Qianchao, et al.
Publicado: (2024)
Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel Execution
por: Qin, Tianrui, et al.
Publicado: (2025)
por: Qin, Tianrui, et al.
Publicado: (2025)
MiMo-V2-Flash Technical Report
por: Core Team, et al.
Publicado: (2026)
por: Core Team, et al.
Publicado: (2026)
Efficient Attention Mechanisms for Large Language Models: A Survey
por: Sun, Yutao, et al.
Publicado: (2025)
por: Sun, Yutao, et al.
Publicado: (2025)
Efficient Knowledge Infusion via KG-LLM Alignment
por: Jiang, Zhouyu, et al.
Publicado: (2024)
por: Jiang, Zhouyu, et al.
Publicado: (2024)
Star Attention: Efficient LLM Inference over Long Sequences
por: Acharya, Shantanu, et al.
Publicado: (2024)
por: Acharya, Shantanu, et al.
Publicado: (2024)
MAR: Efficient Large Language Models via Module-aware Architecture Refinement
por: Cai, Junhong, et al.
Publicado: (2026)
por: Cai, Junhong, et al.
Publicado: (2026)
NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention
por: Zhang, Tianyi, et al.
Publicado: (2024)
por: Zhang, Tianyi, et al.
Publicado: (2024)
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
por: Yun, Jungmin, et al.
Publicado: (2024)
por: Yun, Jungmin, et al.
Publicado: (2024)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
por: Lin, Gang, et al.
Publicado: (2026)
por: Lin, Gang, et al.
Publicado: (2026)
Self-Selected Attention Span for Accelerating Large Language Model Inference
por: Jin, Tian, et al.
Publicado: (2024)
por: Jin, Tian, et al.
Publicado: (2024)
Compressed Convolutional Attention: Efficient Attention in a Compressed Latent Space
por: Figliolia, Tomas, et al.
Publicado: (2025)
por: Figliolia, Tomas, et al.
Publicado: (2025)
Efficient Length-Generalizable Attention via Causal Retrieval for Long-Context Language Modeling
por: Hu, Xiang, et al.
Publicado: (2024)
por: Hu, Xiang, et al.
Publicado: (2024)
HSR-Enhanced Sparse Attention Acceleration
por: Chen, Bo, et al.
Publicado: (2024)
por: Chen, Bo, et al.
Publicado: (2024)
ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
Efficient Streaming Language Models with Attention Sinks
por: Xiao, Guangxuan, et al.
Publicado: (2023)
por: Xiao, Guangxuan, et al.
Publicado: (2023)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
por: Zhang, Hanzhi, et al.
Publicado: (2025)
por: Zhang, Hanzhi, et al.
Publicado: (2025)
Smooth Reading: Bridging the Gap of Recurrent LLM to Self-Attention LLM on Long-Context Tasks
por: Liu, Kai, et al.
Publicado: (2025)
por: Liu, Kai, et al.
Publicado: (2025)
Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information
por: Struppek, Lukas, et al.
Publicado: (2025)
por: Struppek, Lukas, et al.
Publicado: (2025)
SOMA: Efficient Multi-turn LLM Serving via Small Language Model
por: Cheng, Xueqi, et al.
Publicado: (2026)
por: Cheng, Xueqi, et al.
Publicado: (2026)
Ejemplares similares
-
When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models
por: Kostelec, Juan Gabriel, et al.
Publicado: (2026) -
AllMem: A Memory-centric Recipe for Efficient Long-context Modeling
por: Wang, Ziming, et al.
Publicado: (2026) -
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
por: Sharma, Agniv, et al.
Publicado: (2024) -
PLD+: Accelerating LLM inference by leveraging Language Model Artifacts
por: Somasundaram, Shwetha, et al.
Publicado: (2024) -
DeFT: Decoding with Flash Tree-attention for Efficient Tree-structured LLM Inference
por: Yao, Jinwei, et al.
Publicado: (2024)