MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yucheng, Jiang, Huiqiang, Zhang, Chengruidong, Wu, Qianhui, Luo, Xufang, Ahn, Surin, Abdi, Amir H., Li, Dongsheng, Gao, Jianfeng, Yang, Yuqing, Qiu, Lili |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention
par: Jiang, Huiqiang, et autres
Publié: (2024)
par: Jiang, Huiqiang, et autres
Publié: (2024)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
par: Li, Yucheng, et autres
Publié: (2024)
par: Li, Yucheng, et autres
Publié: (2024)
MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
par: Li, Yucheng, et autres
Publié: (2025)
par: Li, Yucheng, et autres
Publié: (2025)
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
par: Jiang, Huiqiang, et autres
Publié: (2023)
par: Jiang, Huiqiang, et autres
Publié: (2023)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
par: Zhang, Yiqi, et autres
Publié: (2026)
par: Zhang, Yiqi, et autres
Publié: (2026)
Accelerating Prefilling via Decoding-time Contribution Sparsity
par: He, Zhiyuan, et autres
Publié: (2025)
par: He, Zhiyuan, et autres
Publié: (2025)
Mitigate Position Bias in Large Language Models via Scaling a Single Dimension
par: Yu, Yijiong, et autres
Publié: (2024)
par: Yu, Yijiong, et autres
Publié: (2024)
On Memory Construction and Retrieval for Personalized Conversational Agents
par: Pan, Zhuoshi, et autres
Publié: (2025)
par: Pan, Zhuoshi, et autres
Publié: (2025)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
LeanK: Learnable K Cache Channel Pruning for Efficient Decoding
par: Zhang, Yike, et autres
Publié: (2025)
par: Zhang, Yike, et autres
Publié: (2025)
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
par: Liu, Anmin, et autres
Publié: (2026)
par: Liu, Anmin, et autres
Publié: (2026)
Unified Medical Image Pre-training in Language-Guided Common Semantic Space
par: He, Xiaoxuan, et autres
Publié: (2023)
par: He, Xiaoxuan, et autres
Publié: (2023)
LLM-RadJudge: Achieving Radiologist-Level Evaluation for X-Ray Report Generation
par: Wang, Zilong, et autres
Publié: (2024)
par: Wang, Zilong, et autres
Publié: (2024)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
par: Liu, Zeyuan, et autres
Publié: (2026)
par: Liu, Zeyuan, et autres
Publié: (2026)
VL Norm: Rethink Loss Aggregation in RLVR
par: He, Zhiyuan, et autres
Publié: (2025)
par: He, Zhiyuan, et autres
Publié: (2025)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
pMoE: Prompting Diverse Experts Together Wins More in Visual Adaptation
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
VisRL: Intention-Driven Visual Perception via Reinforced Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
Position Engineering: Boosting Large Language Models through Positional Information Manipulation
par: He, Zhiyuan, et autres
Publié: (2024)
par: He, Zhiyuan, et autres
Publié: (2024)
Parrot: Efficient Serving of LLM-based Applications with Semantic Variable
par: Lin, Chaofan, et autres
Publié: (2024)
par: Lin, Chaofan, et autres
Publié: (2024)
Region-Adaptive Sampling for Diffusion Transformers
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression
par: Pan, Zhuoshi, et autres
Publié: (2024)
par: Pan, Zhuoshi, et autres
Publié: (2024)
Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty
par: Kim, Jeonghye, et autres
Publié: (2026)
par: Kim, Jeonghye, et autres
Publié: (2026)
Sparser Block-Sparse Attention via Token Permutation
par: Wang, Xinghao, et autres
Publié: (2025)
par: Wang, Xinghao, et autres
Publié: (2025)
Chain-of-Model Learning for Language Model
par: Song, Kaitao, et autres
Publié: (2025)
par: Song, Kaitao, et autres
Publié: (2025)
LSPT: Long-term Spatial Prompt Tuning for Visual Representation Learning
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
A Large-scale Medical Visual Task Adaptation Benchmark
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Agent Lightning: Train ANY AI Agents with Reinforcement Learning
par: Luo, Xufang, et autres
Publié: (2025)
par: Luo, Xufang, et autres
Publié: (2025)
Designing Network Algorithms via Large Language Models
par: He, Zhiyuan, et autres
Publié: (2024)
par: He, Zhiyuan, et autres
Publié: (2024)
Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment
par: Dai, Shenghong, et autres
Publié: (2024)
par: Dai, Shenghong, et autres
Publié: (2024)
Rates of convergence in long time asymptotics of an alignment model with symmetry breaking
par: Surin, Alexandre
Publié: (2025)
par: Surin, Alexandre
Publié: (2025)
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
par: Kim, Jeonghye, et autres
Publié: (2026)
par: Kim, Jeonghye, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key
par: Yang, Zhihe, et autres
Publié: (2025)
par: Yang, Zhihe, et autres
Publié: (2025)
Improving Sparse Autoencoder with Dynamic Attention
par: Wang, Dongsheng, et autres
Publié: (2026)
par: Wang, Dongsheng, et autres
Publié: (2026)
Lag-Relative Sparse Attention In Long Context Training
par: Liang, Manlai, et autres
Publié: (2025)
par: Liang, Manlai, et autres
Publié: (2025)
Rectified Sparse Attention
par: Sun, Yutao, et autres
Publié: (2025)
par: Sun, Yutao, et autres
Publié: (2025)
P‐3.9: The Influence of Parallax and Shape Type Factors on the Perception of AR Equipment in Dark Environment
par: Huiqiang Xia, et autres
Publié: (2024)
par: Huiqiang Xia, et autres
Publié: (2024)
S2O: Early Stopping for Sparse Attention via Online Permutation
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
par: Jayanth, Rakshith, et autres
Publié: (2026)
par: Jayanth, Rakshith, et autres
Publié: (2026)
Documents similaires
-
MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention
par: Jiang, Huiqiang, et autres
Publié: (2024) -
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
par: Li, Yucheng, et autres
Publié: (2024) -
MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
par: Li, Wenxuan, et autres
Publié: (2025) -
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
par: Li, Yucheng, et autres
Publié: (2025) -
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
par: Jiang, Huiqiang, et autres
Publié: (2023)