SLA2: Sparse-Linear Attention with Learnable Routing and QAT
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jintao, Wang, Haoxu, Jiang, Kai, Zheng, Kaiwen, Jiang, Youhe, Stoica, Ion, Chen, Jianfei, Zhu, Jun, Gonzalez, Joseph E. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
di: Zhou, Xuanyi, et al.
Pubblicazione: (2026)
di: Zhou, Xuanyi, et al.
Pubblicazione: (2026)
SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
VSA: Faster Video Diffusion with Trainable Sparse Attention
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
Visual Generation Without Guidance
di: Chen, Huayu, et al.
Pubblicazione: (2025)
di: Chen, Huayu, et al.
Pubblicazione: (2025)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
SageBwd: A Trainable Low-bit Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
DPVO-QAT++: Heterogeneous QAT and CUDA Kernel Fusion for High-Performance Deep Patch Visual Odometry
di: Liao, Cheng
Pubblicazione: (2025)
di: Liao, Cheng
Pubblicazione: (2025)
Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
di: Xi, Haocheng, et al.
Pubblicazione: (2025)
Consistency Diffusion Bridge Models
di: He, Guande, et al.
Pubblicazione: (2024)
di: He, Guande, et al.
Pubblicazione: (2024)
Elucidating the Preconditioning in Consistency Distillation
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
OrthCaps: An Orthogonal CapsNet with Sparse Attention Routing and Pruning
di: Geng, Xinyu, et al.
Pubblicazione: (2024)
di: Geng, Xinyu, et al.
Pubblicazione: (2024)
Fast Video Generation with Sliding Tile Attention
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyuan, et al.
Pubblicazione: (2025)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion
di: Long, Yongji, et al.
Pubblicazione: (2026)
di: Long, Yongji, et al.
Pubblicazione: (2026)
FraQAT: Quantization Aware Training with Fractional bits
di: Morreale, Luca, et al.
Pubblicazione: (2025)
di: Morreale, Luca, et al.
Pubblicazione: (2025)
6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models
di: Su, Rundong, et al.
Pubblicazione: (2026)
di: Su, Rundong, et al.
Pubblicazione: (2026)
VORTA: Efficient Video Diffusion via Routing Sparse Attention
di: Sun, Wenhao, et al.
Pubblicazione: (2025)
di: Sun, Wenhao, et al.
Pubblicazione: (2025)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
AD-DINO: Attention-Dynamic DINO for Distance-Aware Embodied Reference Understanding
di: Guo, Hao, et al.
Pubblicazione: (2024)
di: Guo, Hao, et al.
Pubblicazione: (2024)
Semi-LAR: Semi-supervised Contrastive Learning with Linear Attention for Removal of Nighttime Flares
di: Zhu, Xiyu, et al.
Pubblicazione: (2026)
di: Zhu, Xiyu, et al.
Pubblicazione: (2026)
VisionArena: 230K Real World User-VLM Conversations with Preference Labels
di: Chou, Christopher, et al.
Pubblicazione: (2024)
di: Chou, Christopher, et al.
Pubblicazione: (2024)
GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers
di: Liang, Guang, et al.
Pubblicazione: (2025)
di: Liang, Guang, et al.
Pubblicazione: (2025)
Sparse Semi-DETR: Sparse Learnable Queries for Semi-Supervised Object Detection
di: Shehzadi, Tahira, et al.
Pubblicazione: (2024)
di: Shehzadi, Tahira, et al.
Pubblicazione: (2024)
SageAttention2++: A More Efficient Implementation of SageAttention2
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
MS-GS: Multi-Appearance Sparse-View 3D Gaussian Splatting in the Wild
di: Li, Deming, et al.
Pubblicazione: (2025)
di: Li, Deming, et al.
Pubblicazione: (2025)
RedunCut: Measurement-Driven Sampling and Accuracy Performance Modeling for Low-Cost Live Video Analytics
di: Sela, Gur-Eyal, et al.
Pubblicazione: (2025)
di: Sela, Gur-Eyal, et al.
Pubblicazione: (2025)
Sparse-Up: Learnable Sparse Upsampling for 3D Generation with High-Fidelity Textures
di: Xiao, Lu, et al.
Pubblicazione: (2025)
di: Xiao, Lu, et al.
Pubblicazione: (2025)
Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
di: Li, Xingyang, et al.
Pubblicazione: (2025)
di: Li, Xingyang, et al.
Pubblicazione: (2025)
Learnable Query Aggregation with KV Routing for Cross-view Geo-localisation
di: Ye, Hualin, et al.
Pubblicazione: (2025)
di: Ye, Hualin, et al.
Pubblicazione: (2025)
Managing Bandwidth: The Key to Cloud-Assisted Autonomous Driving
di: Krentsel, Alexander, et al.
Pubblicazione: (2024)
di: Krentsel, Alexander, et al.
Pubblicazione: (2024)
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
di: Liu, Anmin, et al.
Pubblicazione: (2026)
di: Liu, Anmin, et al.
Pubblicazione: (2026)
Learnable Instance Attention Filtering for Adaptive Detector Distillation
di: Liu, Chen, et al.
Pubblicazione: (2026)
di: Liu, Chen, et al.
Pubblicazione: (2026)
PolaFormer: Polarity-aware Linear Attention for Vision Transformers
di: Meng, Weikang, et al.
Pubblicazione: (2025)
di: Meng, Weikang, et al.
Pubblicazione: (2025)
Veda: Scalable Video Diffusion via Distilled Sparse Attention
di: Han, Shihao, et al.
Pubblicazione: (2026)
di: Han, Shihao, et al.
Pubblicazione: (2026)
Efficient Learnable Collaborative Attention for Single Image Super-Resolution
di: Zheng, Yigang Zhao Chaowei, et al.
Pubblicazione: (2024)
di: Zheng, Yigang Zhao Chaowei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
di: Zhang, Jintao, et al.
Pubblicazione: (2025) -
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
di: Zhang, Jintao, et al.
Pubblicazione: (2025) -
SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
di: Zhou, Xuanyi, et al.
Pubblicazione: (2026) -
SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning
di: Zhang, Jintao, et al.
Pubblicazione: (2026) -
SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
di: Zhang, Jintao, et al.
Pubblicazione: (2025)