SoLA-Vision: Fine-grained Layer-wise Linear Softmax Hybrid Attention
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Ruibang, Luo, Guan, Zhang, Yiwei, Gao, Jin, Li, Bing, Hu, Weiming |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Agent Attention: On the Integration of Softmax and Linear Attention
by: Han, Dongchen, et al.
Published: (2023)
by: Han, Dongchen, et al.
Published: (2023)
Bridging the Divide: Reconsidering Softmax and Linear Attention
by: Han, Dongchen, et al.
Published: (2024)
by: Han, Dongchen, et al.
Published: (2024)
Concept-wise Attention for Fine-grained Concept Bottleneck Models
by: Zhong, Minghong, et al.
Published: (2026)
by: Zhong, Minghong, et al.
Published: (2026)
VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization
by: Zhang, Yiwei, et al.
Published: (2024)
by: Zhang, Yiwei, et al.
Published: (2024)
Integrating Diverse Assignment Strategies into DETRs
by: Zhang, Yiwei, et al.
Published: (2026)
by: Zhang, Yiwei, et al.
Published: (2026)
SimA: Simple Softmax-free Attention for Vision Transformers
by: Koohpayegani, Soroush Abbasi, et al.
Published: (2022)
by: Koohpayegani, Soroush Abbasi, et al.
Published: (2022)
DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation
by: Hu, Jie, et al.
Published: (2026)
by: Hu, Jie, et al.
Published: (2026)
SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition
by: Yang, Jingxiao, et al.
Published: (2026)
by: Yang, Jingxiao, et al.
Published: (2026)
BiggerGait: Unlocking Gait Recognition with Layer-wise Representations from Large Vision Models
by: Ye, Dingqiang, et al.
Published: (2025)
by: Ye, Dingqiang, et al.
Published: (2025)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
by: Zhang, Yiwei, et al.
Published: (2026)
by: Zhang, Yiwei, et al.
Published: (2026)
Softmax-free Linear Transformers
by: Lu, Jiachen, et al.
Published: (2022)
by: Lu, Jiachen, et al.
Published: (2022)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
by: Huang, Jiale, et al.
Published: (2024)
by: Huang, Jiale, et al.
Published: (2024)
BEV$^2$PR: BEV-Enhanced Visual Place Recognition with Structural Cues
by: Ge, Fudong, et al.
Published: (2024)
by: Ge, Fudong, et al.
Published: (2024)
Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators
by: Pu, Yifan, et al.
Published: (2024)
by: Pu, Yifan, et al.
Published: (2024)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
by: Li, Yifan, et al.
Published: (2026)
by: Li, Yifan, et al.
Published: (2026)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
by: Li, Xueheng, et al.
Published: (2026)
by: Li, Xueheng, et al.
Published: (2026)
Vision Mamba Distillation for Low-resolution Fine-grained Image Classification
by: Chen, Yao, et al.
Published: (2024)
by: Chen, Yao, et al.
Published: (2024)
PolaFormer: Polarity-aware Linear Attention for Vision Transformers
by: Meng, Weikang, et al.
Published: (2025)
by: Meng, Weikang, et al.
Published: (2025)
Trajectory Attention for Fine-grained Video Motion Control
by: Xiao, Zeqi, et al.
Published: (2024)
by: Xiao, Zeqi, et al.
Published: (2024)
SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking
by: Lin, Shubo, et al.
Published: (2024)
by: Lin, Shubo, et al.
Published: (2024)
GRA: Detecting Oriented Objects through Group-wise Rotating and Attention
by: Wang, Jiangshan, et al.
Published: (2024)
by: Wang, Jiangshan, et al.
Published: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
by: Jing, Liqiang, et al.
Published: (2023)
by: Jing, Liqiang, et al.
Published: (2023)
Fine-grained Image Retrieval via Dual-Vision Adaptation
by: Jiang, Xin, et al.
Published: (2025)
by: Jiang, Xin, et al.
Published: (2025)
Online Segment Any 3D Thing as Instance Tracking
by: Wang, Hanshi, et al.
Published: (2025)
by: Wang, Hanshi, et al.
Published: (2025)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
by: Chng, Yong Xien, et al.
Published: (2024)
by: Chng, Yong Xien, et al.
Published: (2024)
Rethinking Attention: Polynomial Alternatives to Softmax in Transformers
by: Saratchandran, Hemanth, et al.
Published: (2024)
by: Saratchandran, Hemanth, et al.
Published: (2024)
Demystify Mamba in Vision: A Linear Attention Perspective
by: Han, Dongchen, et al.
Published: (2024)
by: Han, Dongchen, et al.
Published: (2024)
DeepIcon: A Hierarchical Network for Layer-wise Icon Vectorization
by: Bing, Qi, et al.
Published: (2024)
by: Bing, Qi, et al.
Published: (2024)
Why Fine-grained Labels in Pretraining Benefit Generalization?
by: Hong, Guan Zhe, et al.
Published: (2024)
by: Hong, Guan Zhe, et al.
Published: (2024)
DVHGNN: Multi-Scale Dilated Vision HGNN for Efficient Vision Recognition
by: Li, Caoshuo, et al.
Published: (2025)
by: Li, Caoshuo, et al.
Published: (2025)
LampQ: Towards Accurate Layer-wise Mixed Precision Quantization for Vision Transformers
by: Kim, Minjun, et al.
Published: (2025)
by: Kim, Minjun, et al.
Published: (2025)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
by: Lu, Yifan, et al.
Published: (2025)
by: Lu, Yifan, et al.
Published: (2025)
Hybrid-Tower: Fine-grained Pseudo-query Interaction and Generation for Text-to-Video Retrieval
by: Lan, Bangxiang, et al.
Published: (2025)
by: Lan, Bangxiang, et al.
Published: (2025)
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference
by: Liu, Anmin, et al.
Published: (2026)
by: Liu, Anmin, et al.
Published: (2026)
Block-wise LoRA: Revisiting Fine-grained LoRA for Effective Personalization and Stylization in Text-to-Image Generation
by: Li, Likun, et al.
Published: (2024)
by: Li, Likun, et al.
Published: (2024)
Vision Transformers are Circulant Attention Learners
by: Han, Dongchen, et al.
Published: (2025)
by: Han, Dongchen, et al.
Published: (2025)
Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
by: Li, Jiaye, et al.
Published: (2025)
by: Li, Jiaye, et al.
Published: (2025)
Balanced 3DGS: Gaussian-wise Parallelism Rendering with Fine-Grained Tiling
by: Gui, Hao, et al.
Published: (2024)
by: Gui, Hao, et al.
Published: (2024)
Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
LayerCache: Exploiting Layer-wise Velocity Heterogeneity for Efficient Flow Matching Inference
by: Li, Guandong
Published: (2026)
by: Li, Guandong
Published: (2026)
Similar Items
-
Agent Attention: On the Integration of Softmax and Linear Attention
by: Han, Dongchen, et al.
Published: (2023) -
Bridging the Divide: Reconsidering Softmax and Linear Attention
by: Han, Dongchen, et al.
Published: (2024) -
Concept-wise Attention for Fine-grained Concept Bottleneck Models
by: Zhong, Minghong, et al.
Published: (2026) -
VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization
by: Zhang, Yiwei, et al.
Published: (2024) -
Integrating Diverse Assignment Strategies into DETRs
by: Zhang, Yiwei, et al.
Published: (2026)