BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Chaodong, Zhang, Zhengqiang, Zhang, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Polyline Path Masked Attention for Vision Transformer
par: Zhao, Zhongchen, et autres
Publié: (2025)
par: Zhao, Zhongchen, et autres
Publié: (2025)
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
par: Xiao, Chaodong, et autres
Publié: (2024)
par: Xiao, Chaodong, et autres
Publié: (2024)
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
par: Luo, Jiayi, et autres
Publié: (2026)
par: Luo, Jiayi, et autres
Publié: (2026)
Vision Transformers with Hierarchical Attention
par: Liu, Yun, et autres
Publié: (2021)
par: Liu, Yun, et autres
Publié: (2021)
Spiking Vision Transformer with Saccadic Attention
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Representative Attention For Vision Transformers
par: Li, Yuntong, et autres
Publié: (2026)
par: Li, Yuntong, et autres
Publié: (2026)
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?
par: Sun, Lingchen, et autres
Publié: (2026)
par: Sun, Lingchen, et autres
Publié: (2026)
One-Step Diffusion for Detail-Rich and Temporally Consistent Video Super-Resolution
par: Sun, Yujing, et autres
Publié: (2025)
par: Sun, Yujing, et autres
Publié: (2025)
HAViT: Historical Attention Vision Transformer
par: Banik, Swarnendu, et autres
Publié: (2026)
par: Banik, Swarnendu, et autres
Publié: (2026)
Structured Initialization for Attention in Vision Transformers
par: Zheng, Jianqiao, et autres
Publié: (2024)
par: Zheng, Jianqiao, et autres
Publié: (2024)
Vision Transformers are Circulant Attention Learners
par: Han, Dongchen, et autres
Publié: (2025)
par: Han, Dongchen, et autres
Publié: (2025)
Multi-manifold Attention for Vision Transformers
par: Konstantinidis, Dimitrios, et autres
Publié: (2022)
par: Konstantinidis, Dimitrios, et autres
Publié: (2022)
FreCaS: Efficient Higher-Resolution Image Generation via Frequency-aware Cascaded Sampling
par: Zhang, Zhengqiang, et autres
Publié: (2024)
par: Zhang, Zhengqiang, et autres
Publié: (2024)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
par: Lee, Sanghyeok, et autres
Publié: (2024)
par: Lee, Sanghyeok, et autres
Publié: (2024)
Attention Retention for Continual Learning with Vision Transformers
par: Lu, Yue, et autres
Publié: (2026)
par: Lu, Yue, et autres
Publié: (2026)
One Attention, One Scale: Phase-Aligned Rotary Positional Embeddings for Mixed-Resolution Diffusion Transformer
par: Wu, Haoyu, et autres
Publié: (2025)
par: Wu, Haoyu, et autres
Publié: (2025)
Lightweight Vision Transformer with Window and Spatial Attention for Food Image Classification
par: Gao, Xinle, et autres
Publié: (2025)
par: Gao, Xinle, et autres
Publié: (2025)
ScatterFormer: Efficient Voxel Transformer with Scattered Linear Attention
par: He, Chenhang, et autres
Publié: (2024)
par: He, Chenhang, et autres
Publié: (2024)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
par: Yuan, Zhihang, et autres
Publié: (2024)
par: Yuan, Zhihang, et autres
Publié: (2024)
Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention
par: Zhang, Tianxiao, et autres
Publié: (2024)
par: Zhang, Tianxiao, et autres
Publié: (2024)
Analysis of Attention in Video Diffusion Transformers
par: Wen, Yuxin, et autres
Publié: (2025)
par: Wen, Yuxin, et autres
Publié: (2025)
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
par: Ding, Hangliang, et autres
Publié: (2025)
par: Ding, Hangliang, et autres
Publié: (2025)
Calibration Attention: Learning Reliability-Aware Representations for Vision Transformers
par: Liang, Wenhao, et autres
Publié: (2025)
par: Liang, Wenhao, et autres
Publié: (2025)
You Only Need Less Attention at Each Stage in Vision Transformers
par: Zhang, Shuoxi, et autres
Publié: (2024)
par: Zhang, Shuoxi, et autres
Publié: (2024)
One Last Attention for Your Vision-Language Model
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution
par: Yi, Qiaosi, et autres
Publié: (2026)
par: Yi, Qiaosi, et autres
Publié: (2026)
Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer Inference
par: You, Haoran, et autres
Publié: (2022)
par: You, Haoran, et autres
Publié: (2022)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
par: Fang, Tongcheng, et autres
Publié: (2026)
par: Fang, Tongcheng, et autres
Publié: (2026)
DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer
par: Tang, Xiaoya, et autres
Publié: (2025)
par: Tang, Xiaoya, et autres
Publié: (2025)
Decision-Aware Attention Propagation for Vision Transformer Explainability
par: Jo, Sehyeong, et autres
Publié: (2026)
par: Jo, Sehyeong, et autres
Publié: (2026)
Learning Visual Prompts for Guiding the Attention of Vision Transformers
par: Rezaei, Razieh, et autres
Publié: (2024)
par: Rezaei, Razieh, et autres
Publié: (2024)
Elastic Attention Cores for Scalable Vision Transformers
par: Song, Alan Z., et autres
Publié: (2026)
par: Song, Alan Z., et autres
Publié: (2026)
LiteAttention: A Temporal Sparse Attention for Diffusion Transformers
par: Shmilovich, Dor, et autres
Publié: (2025)
par: Shmilovich, Dor, et autres
Publié: (2025)
Hierarchical and Step-Layer-Wise Tuning of Attention Specialty for Multi-Instance Synthesis in Diffusion Transformers
par: Zhang, Chunyang, et autres
Publié: (2025)
par: Zhang, Chunyang, et autres
Publié: (2025)
Attention Sinks in Diffusion Transformers: A Causal Analysis
par: Wu, Fangzheng, et autres
Publié: (2026)
par: Wu, Fangzheng, et autres
Publié: (2026)
SSL: A Self-similarity Loss for Improving Generative Image Super-resolution
par: Chen, Du, et autres
Publié: (2024)
par: Chen, Du, et autres
Publié: (2024)
GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
par: Zhang, Zhengqiang, et autres
Publié: (2025)
par: Zhang, Zhengqiang, et autres
Publié: (2025)
The Linear Attention Resurrection in Vision Transformer
par: Zheng, Chuanyang
Publié: (2025)
par: Zheng, Chuanyang
Publié: (2025)
VOSR: A Vision-Only Generative Model for Image Super-Resolution
par: Wu, Rongyuan, et autres
Publié: (2026)
par: Wu, Rongyuan, et autres
Publié: (2026)
Documents similaires
-
Polyline Path Masked Attention for Vision Transformer
par: Zhao, Zhongchen, et autres
Publié: (2025) -
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
par: Xiao, Chaodong, et autres
Publié: (2024) -
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
par: Luo, Jiayi, et autres
Publié: (2026) -
Vision Transformers with Hierarchical Attention
par: Liu, Yun, et autres
Publié: (2021) -
Spiking Vision Transformer with Saccadic Attention
par: Wang, Shuai, et autres
Publié: (2025)