Polyline Path Masked Attention for Vision Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Zhongchen, Xiao, Chaodong, Lin, Hui, Xie, Qi, Zhang, Lei, Meng, Deyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
par: Xiao, Chaodong, et autres
Publié: (2026)
par: Xiao, Chaodong, et autres
Publié: (2026)
Rotation Equivariant Mamba for Vision Tasks
par: Zhao, Zhongchen, et autres
Publié: (2026)
par: Zhao, Zhongchen, et autres
Publié: (2026)
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
par: Xiao, Chaodong, et autres
Publié: (2024)
par: Xiao, Chaodong, et autres
Publié: (2024)
Vanilla Group Equivariant Vision Transformer: Simple and Effective
par: Fu, Jiahong, et autres
Publié: (2026)
par: Fu, Jiahong, et autres
Publié: (2026)
Gramformer: Learning Crowd Counting via Graph-Modulated Transformer
par: Lin, Hui, et autres
Publié: (2024)
par: Lin, Hui, et autres
Publié: (2024)
YOLinO++: Single-Shot Estimation of Generic Polylines for Mapless Automated Diving
par: Meyer, Annika, et autres
Publié: (2024)
par: Meyer, Annika, et autres
Publié: (2024)
Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning
par: Qi, Zhuang, et autres
Publié: (2025)
par: Qi, Zhuang, et autres
Publié: (2025)
Feature Alignment with Equivariant Convolutions for Burst Image Super-Resolution
par: Liu, Xinyi, et autres
Publié: (2025)
par: Liu, Xinyi, et autres
Publié: (2025)
Rotation-Equivariant Self-Supervised Method in Image Denoising
par: Liu, Hanze, et autres
Publié: (2025)
par: Liu, Hanze, et autres
Publié: (2025)
Rotation Equivariant Arbitrary-scale Image Super-Resolution
par: Xie, Qi, et autres
Publié: (2025)
par: Xie, Qi, et autres
Publié: (2025)
A Regularization-Guided Equivariant Approach for Image Restoration
par: Bai, Yulu, et autres
Publié: (2025)
par: Bai, Yulu, et autres
Publié: (2025)
Aligning Network Equivariance with Data Symmetry: A Theoretical Framework and Adaptive Approach for Image Restoration
par: Tan, Feiyu, et autres
Publié: (2026)
par: Tan, Feiyu, et autres
Publié: (2026)
Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers
par: Shou, Yuntao, et autres
Publié: (2026)
par: Shou, Yuntao, et autres
Publié: (2026)
Video Super-Resolution Transformer with Masked Inter&Intra-Frame Attention
par: Zhou, Xingyu, et autres
Publié: (2024)
par: Zhou, Xingyu, et autres
Publié: (2024)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
par: Xiao, Changming, et autres
Publié: (2023)
par: Xiao, Changming, et autres
Publié: (2023)
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
par: Wu, Biao, et autres
Publié: (2024)
par: Wu, Biao, et autres
Publié: (2024)
Vision Transformers with Hierarchical Attention
par: Liu, Yun, et autres
Publié: (2021)
par: Liu, Yun, et autres
Publié: (2021)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
par: Tong, Chaodong, et autres
Publié: (2026)
par: Tong, Chaodong, et autres
Publié: (2026)
Diffusion-Guided Mask-Consistent Paired Mixing for Endoscopic Image Segmentation
par: Jie, Pengyu, et autres
Publié: (2025)
par: Jie, Pengyu, et autres
Publié: (2025)
Continuous Filtered Backprojection by Learnable Interpolation Network
par: Lin, Hui, et autres
Publié: (2025)
par: Lin, Hui, et autres
Publié: (2025)
MATIS: Masked-Attention Transformers for Surgical Instrument Segmentation
par: Ayobi, Nicolás, et autres
Publié: (2023)
par: Ayobi, Nicolás, et autres
Publié: (2023)
You Only Need Less Attention at Each Stage in Vision Transformers
par: Zhang, Shuoxi, et autres
Publié: (2024)
par: Zhang, Shuoxi, et autres
Publié: (2024)
Continuous Representation Methods, Theories, and Applications: An Overview and Perspectives
par: Luo, Yisi, et autres
Publié: (2025)
par: Luo, Yisi, et autres
Publié: (2025)
Spiking Vision Transformer with Saccadic Attention
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Calibration Attention: Learning Reliability-Aware Representations for Vision Transformers
par: Liang, Wenhao, et autres
Publié: (2025)
par: Liang, Wenhao, et autres
Publié: (2025)
Representative Attention For Vision Transformers
par: Li, Yuntong, et autres
Publié: (2026)
par: Li, Yuntong, et autres
Publié: (2026)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025)
par: Qi, Tianhao, et autres
Publié: (2025)
Lightweight Vision Transformer with Window and Spatial Attention for Food Image Classification
par: Gao, Xinle, et autres
Publié: (2025)
par: Gao, Xinle, et autres
Publié: (2025)
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
par: Yan, Xiaoshuo, et autres
Publié: (2025)
par: Yan, Xiaoshuo, et autres
Publié: (2025)
MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers
par: Ma, Haoyu, et autres
Publié: (2023)
par: Ma, Haoyu, et autres
Publié: (2023)
S2AFormer: Strip Self-Attention for Efficient Vision Transformer
par: Xu, Guoan, et autres
Publié: (2025)
par: Xu, Guoan, et autres
Publié: (2025)
Generative Latent Kernel Modeling for Blind Motion Deblurring
par: Ding, Chenhao, et autres
Publié: (2025)
par: Ding, Chenhao, et autres
Publié: (2025)
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
par: Liu, Jinyang, et autres
Publié: (2024)
par: Liu, Jinyang, et autres
Publié: (2024)
Cross-modulated Attention Transformer for RGBT Tracking
par: Xiao, Yun, et autres
Publié: (2024)
par: Xiao, Yun, et autres
Publié: (2024)
Image-to-Image Translation Framework Embedded with Rotation Symmetry Priors
par: Tan, Feiyu, et autres
Publié: (2026)
par: Tan, Feiyu, et autres
Publié: (2026)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
par: Cai, Lingling, et autres
Publié: (2024)
par: Cai, Lingling, et autres
Publié: (2024)
PolaFormer: Polarity-aware Linear Attention for Vision Transformers
par: Meng, Weikang, et autres
Publié: (2025)
par: Meng, Weikang, et autres
Publié: (2025)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
par: Gao, Jin, et autres
Publié: (2024)
par: Gao, Jin, et autres
Publié: (2024)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
par: Chen, Wenchao, et autres
Publié: (2024)
par: Chen, Wenchao, et autres
Publié: (2024)
Enhancing Underwater Light Field Images via Global Geometry-aware Diffusion Process
par: Lin, Yuji, et autres
Publié: (2026)
par: Lin, Yuji, et autres
Publié: (2026)
Documents similaires
-
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
par: Xiao, Chaodong, et autres
Publié: (2026) -
Rotation Equivariant Mamba for Vision Tasks
par: Zhao, Zhongchen, et autres
Publié: (2026) -
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
par: Xiao, Chaodong, et autres
Publié: (2024) -
Vanilla Group Equivariant Vision Transformer: Simple and Effective
par: Fu, Jiahong, et autres
Publié: (2026) -
Gramformer: Learning Crowd Counting via Graph-Modulated Transformer
par: Lin, Hui, et autres
Publié: (2024)