OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Feng, He, Yefei, He, Shaoxuan, He, Yuanyu, Liu, Jing, Lin, Lequan, Liu, Akide, Li, Zhaoyang, Zhang, Jiyuan, Sun, Zhenbang, Zhuang, Bohan, Wu, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparsity Forcing: Reinforcing Token Sparsity of MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
Neighboring Autoregressive Modeling for Efficient Visual Generation
di: He, Yefei, et al.
Pubblicazione: (2025)
di: He, Yefei, et al.
Pubblicazione: (2025)
ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024)
di: Liu, Akide, et al.
Pubblicazione: (2024)
EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models
di: He, Yefei, et al.
Pubblicazione: (2023)
di: He, Yefei, et al.
Pubblicazione: (2023)
ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation
di: Liu, Akide, et al.
Pubblicazione: (2026)
di: Liu, Akide, et al.
Pubblicazione: (2026)
FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion
di: Liu, Akide, et al.
Pubblicazione: (2025)
di: Liu, Akide, et al.
Pubblicazione: (2025)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
di: Zhou, Junkang, et al.
Pubblicazione: (2026)
di: Zhou, Junkang, et al.
Pubblicazione: (2026)
DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation
di: Hu, Jie, et al.
Pubblicazione: (2026)
di: Hu, Jie, et al.
Pubblicazione: (2026)
PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
LVSA: Training-Free Sparse Attention for Long Video Diffusion
di: Glorian, Gael, et al.
Pubblicazione: (2026)
di: Glorian, Gael, et al.
Pubblicazione: (2026)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
ME-Switch: A Memory-Efficient Expert Switching Framework for Large Language Models
di: Liu, Jing, et al.
Pubblicazione: (2024)
di: Liu, Jing, et al.
Pubblicazione: (2024)
An Empirical Study on How Video-LLMs Answer Video Questions
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
di: Gu, Youping, et al.
Pubblicazione: (2025)
di: Gu, Youping, et al.
Pubblicazione: (2025)
Motion Mamba: Efficient and Long Sequence Motion Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
Less Detail, Better Answers: Degradation-Driven Prompting for VQA
di: Han, Haoxuan, et al.
Pubblicazione: (2026)
di: Han, Haoxuan, et al.
Pubblicazione: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
Lag-Relative Sparse Attention In Long Context Training
di: Liang, Manlai, et al.
Pubblicazione: (2025)
di: Liang, Manlai, et al.
Pubblicazione: (2025)
A Unified Sparse Attention via Multi-Granularity Compression
di: Liu, Siran, et al.
Pubblicazione: (2025)
di: Liu, Siran, et al.
Pubblicazione: (2025)
Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention
di: Xu, Yufei, et al.
Pubblicazione: (2026)
di: Xu, Yufei, et al.
Pubblicazione: (2026)
ZPressor: Bottleneck-Aware Compression for Scalable Feed-Forward 3DGS
di: Wang, Weijie, et al.
Pubblicazione: (2025)
di: Wang, Weijie, et al.
Pubblicazione: (2025)
Training-free and Adaptive Sparse Attention for Efficient Long Video Generation
di: Xia, Yifei, et al.
Pubblicazione: (2025)
di: Xia, Yifei, et al.
Pubblicazione: (2025)
SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
di: Zhang, Zeyu, et al.
Pubblicazione: (2024)
LongVLM: Efficient Long Video Understanding via Large Language Models
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
Approximate Multiplication of Sparse Matrices with Limited Space
di: Wan, Yuanyu, et al.
Pubblicazione: (2020)
di: Wan, Yuanyu, et al.
Pubblicazione: (2020)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
di: Li, Caorui, et al.
Pubblicazione: (2025)
di: Li, Caorui, et al.
Pubblicazione: (2025)
Dynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMs
di: Zhang, Yuxin, et al.
Pubblicazione: (2023)
di: Zhang, Yuxin, et al.
Pubblicazione: (2023)
SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention
di: Xu, Hongtao, et al.
Pubblicazione: (2026)
di: Xu, Hongtao, et al.
Pubblicazione: (2026)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation
di: Lu, Beijia, et al.
Pubblicazione: (2025)
di: Lu, Beijia, et al.
Pubblicazione: (2025)
Bidirectional Sparse Attention for Faster Video Diffusion Training
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
Prism: Spectral-Aware Block-Sparse Attention
di: Wang, Xinghao, et al.
Pubblicazione: (2026)
di: Wang, Xinghao, et al.
Pubblicazione: (2026)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
Alleviating Forgetfulness of Linear Attention by Hybrid Sparse Attention and Contextualized Learnable Token Eviction
di: He, Mutian, et al.
Pubblicazione: (2025)
di: He, Mutian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sparsity Forcing: Reinforcing Token Sparsity of MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025) -
Neighboring Autoregressive Modeling for Efficient Visual Generation
di: He, Yefei, et al.
Pubblicazione: (2025) -
ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality
di: He, Yefei, et al.
Pubblicazione: (2024) -
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024) -
EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models
di: He, Yefei, et al.
Pubblicazione: (2023)