MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Kewei, Huang, Ye, Deng, Yufan, Yu, Jincheng, Chen, Junsong, Ling, Huan, Xie, Enze, Zhou, Daquan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HumanNet: Scaling Human-centric Video Learning to One Million Hours
par: Deng, Yufan, et autres
Publié: (2026)
par: Deng, Yufan, et autres
Publié: (2026)
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
par: Zhu, Haoyi, et autres
Publié: (2026)
par: Zhu, Haoyi, et autres
Publié: (2026)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
par: Xie, Enze, et autres
Publié: (2025)
par: Xie, Enze, et autres
Publié: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
par: Wu, Yecheng, et autres
Publié: (2025)
par: Wu, Yecheng, et autres
Publié: (2025)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation
par: Zhang, Hongyu, et autres
Publié: (2026)
par: Zhang, Hongyu, et autres
Publié: (2026)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
par: Zhao, Yuyang, et autres
Publié: (2026)
par: Zhao, Yuyang, et autres
Publié: (2026)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
par: Qiao, Bingtian, et autres
Publié: (2026)
par: Qiao, Bingtian, et autres
Publié: (2026)
Real-time One-Step Diffusion-based Expressive Portrait Videos Generation
par: Guo, Hanzhong, et autres
Publié: (2024)
par: Guo, Hanzhong, et autres
Publié: (2024)
Interactive Multi-Head Self-Attention with Linear Complexity
par: Kang, Hankyul, et autres
Publié: (2024)
par: Kang, Hankyul, et autres
Publié: (2024)
Enhancing Spatial Understanding in Image Generation via Reward Modeling
par: Tang, Zhenyu, et autres
Publié: (2026)
par: Tang, Zhenyu, et autres
Publié: (2026)
Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation
par: Tang, Lexiang, et autres
Publié: (2025)
par: Tang, Lexiang, et autres
Publié: (2025)
SAGA: Selective Adaptive Gating for Efficient and Expressive Linear Attention
par: Cao, Yuan, et autres
Publié: (2025)
par: Cao, Yuan, et autres
Publié: (2025)
PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
par: Chen, Junsong, et autres
Publié: (2023)
par: Chen, Junsong, et autres
Publié: (2023)
TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
par: Ma, Yifeng, et autres
Publié: (2023)
par: Ma, Yifeng, et autres
Publié: (2023)
Magic 1-For-1: Generating One Minute Video Clips within One Minute
par: Yi, Hongwei, et autres
Publié: (2025)
par: Yi, Hongwei, et autres
Publié: (2025)
Selective LoRA for Visual Tokens and Attention Heads
par: Luo, Tiange, et autres
Publié: (2025)
par: Luo, Tiange, et autres
Publié: (2025)
Low-Resolution Self-Attention for Semantic Segmentation
par: Wu, Yu-Huan, et autres
Publié: (2023)
par: Wu, Yu-Huan, et autres
Publié: (2023)
ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling
par: Babiloni, Francesca, et autres
Publié: (2024)
par: Babiloni, Francesca, et autres
Publié: (2024)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
par: Xie, Enze, et autres
Publié: (2024)
par: Xie, Enze, et autres
Publié: (2024)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
par: Zhou, Yupeng, et autres
Publié: (2024)
par: Zhou, Yupeng, et autres
Publié: (2024)
Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment
par: Huang, Huayang, et autres
Publié: (2026)
par: Huang, Huayang, et autres
Publié: (2026)
Token-Level Inference-Time Alignment for Vision-Language Models
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
GLMHA A Guided Low-rank Multi-Head Self-Attention for Efficient Image Restoration and Spectral Reconstruction
par: Ilyas, Zaid, et autres
Publié: (2024)
par: Ilyas, Zaid, et autres
Publié: (2024)
MoH: Multi-Head Attention as Mixture-of-Head Attention
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
Breaking Complexity Barriers: High-Resolution Image Restoration with Rank Enhanced Linear Attention
par: Ai, Yuang, et autres
Publié: (2025)
par: Ai, Yuang, et autres
Publié: (2025)
FreeBlend: Advancing Concept Blending with Staged Feedback-Driven Interpolation Diffusion
par: Zhou, Yufan, et autres
Publié: (2025)
par: Zhou, Yufan, et autres
Publié: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
par: Du, Yuzhen, et autres
Publié: (2024)
par: Du, Yuzhen, et autres
Publié: (2024)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
par: Chen, Beitao, et autres
Publié: (2025)
par: Chen, Beitao, et autres
Publié: (2025)
DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
par: Zhao, Xiaochen, et autres
Publié: (2025)
par: Zhao, Xiaochen, et autres
Publié: (2025)
High-Fidelity Mural Restoration via a Unified Hybrid Mask-Aware Transformer
par: Jiang, Jincheng, et autres
Publié: (2026)
par: Jiang, Jincheng, et autres
Publié: (2026)
Controllable and Expressive One-Shot Video Head Swapping
par: Ji, Chaonan, et autres
Publié: (2025)
par: Ji, Chaonan, et autres
Publié: (2025)
Restorer: Removing Multi-Degradation with All-Axis Attention and Prompt Guidance
par: Mao, Jiawei, et autres
Publié: (2024)
par: Mao, Jiawei, et autres
Publié: (2024)
Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention
par: Zhang, Tianxiao, et autres
Publié: (2024)
par: Zhang, Tianxiao, et autres
Publié: (2024)
Agent Attention: On the Integration of Softmax and Linear Attention
par: Han, Dongchen, et autres
Publié: (2023)
par: Han, Dongchen, et autres
Publié: (2023)
Instant Expressive Gaussian Head Avatar via 3D-Aware Expression Distillation
par: Jiang, Kaiwen, et autres
Publié: (2025)
par: Jiang, Kaiwen, et autres
Publié: (2025)
PIXART-δ: Fast and Controllable Image Generation with Latent Consistency Models
par: Chen, Junsong, et autres
Publié: (2024)
par: Chen, Junsong, et autres
Publié: (2024)
HAT: Hybrid Attention Transformer for Image Restoration
par: Chen, Xiangyu, et autres
Publié: (2023)
par: Chen, Xiangyu, et autres
Publié: (2023)
X-Portrait: Expressive Portrait Animation with Hierarchical Motion Attention
par: Xie, You, et autres
Publié: (2024)
par: Xie, You, et autres
Publié: (2024)
Documents similaires
-
HumanNet: Scaling Human-centric Video Learning to One Million Hours
par: Deng, Yufan, et autres
Publié: (2026) -
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
par: Zhu, Haoyi, et autres
Publié: (2026) -
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
par: Xie, Enze, et autres
Publié: (2025) -
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
par: Wu, Yecheng, et autres
Publié: (2025) -
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)