MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Kewei, Huang, Ye, Deng, Yufan, Yu, Jincheng, Chen, Junsong, Ling, Huan, Xie, Enze, Zhou, Daquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HumanNet: Scaling Human-centric Video Learning to One Million Hours
di: Deng, Yufan, et al.
Pubblicazione: (2026)
di: Deng, Yufan, et al.
Pubblicazione: (2026)
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
di: Zhu, Haoyi, et al.
Pubblicazione: (2026)
di: Zhu, Haoyi, et al.
Pubblicazione: (2026)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
di: Xie, Enze, et al.
Pubblicazione: (2025)
di: Xie, Enze, et al.
Pubblicazione: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
di: Chen, Junsong, et al.
Pubblicazione: (2025)
di: Chen, Junsong, et al.
Pubblicazione: (2025)
TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation
di: Zhang, Hongyu, et al.
Pubblicazione: (2026)
di: Zhang, Hongyu, et al.
Pubblicazione: (2026)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
di: Qiao, Bingtian, et al.
Pubblicazione: (2026)
di: Qiao, Bingtian, et al.
Pubblicazione: (2026)
Real-time One-Step Diffusion-based Expressive Portrait Videos Generation
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
di: Guo, Hanzhong, et al.
Pubblicazione: (2024)
Enhancing Spatial Understanding in Image Generation via Reward Modeling
di: Tang, Zhenyu, et al.
Pubblicazione: (2026)
di: Tang, Zhenyu, et al.
Pubblicazione: (2026)
Interactive Multi-Head Self-Attention with Linear Complexity
di: Kang, Hankyul, et al.
Pubblicazione: (2024)
di: Kang, Hankyul, et al.
Pubblicazione: (2024)
Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation
di: Tang, Lexiang, et al.
Pubblicazione: (2025)
di: Tang, Lexiang, et al.
Pubblicazione: (2025)
SAGA: Selective Adaptive Gating for Efficient and Expressive Linear Attention
di: Cao, Yuan, et al.
Pubblicazione: (2025)
di: Cao, Yuan, et al.
Pubblicazione: (2025)
PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
di: Chen, Junsong, et al.
Pubblicazione: (2023)
di: Chen, Junsong, et al.
Pubblicazione: (2023)
TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
di: Ma, Yifeng, et al.
Pubblicazione: (2023)
di: Ma, Yifeng, et al.
Pubblicazione: (2023)
Magic 1-For-1: Generating One Minute Video Clips within One Minute
di: Yi, Hongwei, et al.
Pubblicazione: (2025)
di: Yi, Hongwei, et al.
Pubblicazione: (2025)
Selective LoRA for Visual Tokens and Attention Heads
di: Luo, Tiange, et al.
Pubblicazione: (2025)
di: Luo, Tiange, et al.
Pubblicazione: (2025)
Low-Resolution Self-Attention for Semantic Segmentation
di: Wu, Yu-Huan, et al.
Pubblicazione: (2023)
di: Wu, Yu-Huan, et al.
Pubblicazione: (2023)
ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling
di: Babiloni, Francesca, et al.
Pubblicazione: (2024)
di: Babiloni, Francesca, et al.
Pubblicazione: (2024)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
di: Xie, Enze, et al.
Pubblicazione: (2024)
di: Xie, Enze, et al.
Pubblicazione: (2024)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
di: Zhou, Yupeng, et al.
Pubblicazione: (2024)
di: Zhou, Yupeng, et al.
Pubblicazione: (2024)
Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment
di: Huang, Huayang, et al.
Pubblicazione: (2026)
di: Huang, Huayang, et al.
Pubblicazione: (2026)
Token-Level Inference-Time Alignment for Vision-Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
GLMHA A Guided Low-rank Multi-Head Self-Attention for Efficient Image Restoration and Spectral Reconstruction
di: Ilyas, Zaid, et al.
Pubblicazione: (2024)
di: Ilyas, Zaid, et al.
Pubblicazione: (2024)
MoH: Multi-Head Attention as Mixture-of-Head Attention
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
Breaking Complexity Barriers: High-Resolution Image Restoration with Rank Enhanced Linear Attention
di: Ai, Yuang, et al.
Pubblicazione: (2025)
di: Ai, Yuang, et al.
Pubblicazione: (2025)
FreeBlend: Advancing Concept Blending with Staged Feedback-Driven Interpolation Diffusion
di: Zhou, Yufan, et al.
Pubblicazione: (2025)
di: Zhou, Yufan, et al.
Pubblicazione: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
di: Du, Yuzhen, et al.
Pubblicazione: (2024)
di: Du, Yuzhen, et al.
Pubblicazione: (2024)
DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
di: Chen, Beitao, et al.
Pubblicazione: (2025)
di: Chen, Beitao, et al.
Pubblicazione: (2025)
X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
di: Zhao, Xiaochen, et al.
Pubblicazione: (2025)
di: Zhao, Xiaochen, et al.
Pubblicazione: (2025)
High-Fidelity Mural Restoration via a Unified Hybrid Mask-Aware Transformer
di: Jiang, Jincheng, et al.
Pubblicazione: (2026)
di: Jiang, Jincheng, et al.
Pubblicazione: (2026)
Controllable and Expressive One-Shot Video Head Swapping
di: Ji, Chaonan, et al.
Pubblicazione: (2025)
di: Ji, Chaonan, et al.
Pubblicazione: (2025)
Restorer: Removing Multi-Degradation with All-Axis Attention and Prompt Guidance
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
Agent Attention: On the Integration of Softmax and Linear Attention
di: Han, Dongchen, et al.
Pubblicazione: (2023)
di: Han, Dongchen, et al.
Pubblicazione: (2023)
PIXART-δ: Fast and Controllable Image Generation with Latent Consistency Models
di: Chen, Junsong, et al.
Pubblicazione: (2024)
di: Chen, Junsong, et al.
Pubblicazione: (2024)
Instant Expressive Gaussian Head Avatar via 3D-Aware Expression Distillation
di: Jiang, Kaiwen, et al.
Pubblicazione: (2025)
di: Jiang, Kaiwen, et al.
Pubblicazione: (2025)
HAT: Hybrid Attention Transformer for Image Restoration
di: Chen, Xiangyu, et al.
Pubblicazione: (2023)
di: Chen, Xiangyu, et al.
Pubblicazione: (2023)
X-Portrait: Expressive Portrait Animation with Hierarchical Motion Attention
di: Xie, You, et al.
Pubblicazione: (2024)
di: Xie, You, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HumanNet: Scaling Human-centric Video Learning to One Million Hours
di: Deng, Yufan, et al.
Pubblicazione: (2026) -
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
di: Zhu, Haoyi, et al.
Pubblicazione: (2026) -
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
di: Xie, Enze, et al.
Pubblicazione: (2025) -
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025) -
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
di: Chen, Junsong, et al.
Pubblicazione: (2025)