SPFormer: Enhancing Vision Transformer with Superpixel Representation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mei, Jieru, Chen, Liang-Chieh, Yuille, Alan, Xie, Cihang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
von: Xie, Yunfei, et al.
Veröffentlicht: (2024)
von: Xie, Yunfei, et al.
Veröffentlicht: (2024)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
von: Wang, Feng, et al.
Veröffentlicht: (2023)
von: Wang, Feng, et al.
Veröffentlicht: (2023)
Mamba-R: Vision Mamba ALSO Needs Registers
von: Wang, Feng, et al.
Veröffentlicht: (2024)
von: Wang, Feng, et al.
Veröffentlicht: (2024)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
von: Li, Zhuowan, et al.
Veröffentlicht: (2022)
von: Li, Zhuowan, et al.
Veröffentlicht: (2022)
ViT-5: Vision Transformers for The Mid-2020s
von: Wang, Feng, et al.
Veröffentlicht: (2026)
von: Wang, Feng, et al.
Veröffentlicht: (2026)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Autoregressive Pretraining with Mamba in Vision
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Rejuvenating image-GPT as Strong Visual Representation Learners
von: Ren, Sucheng, et al.
Veröffentlicht: (2023)
von: Ren, Sucheng, et al.
Veröffentlicht: (2023)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
von: Chen, Jieneng, et al.
Veröffentlicht: (2024)
von: Chen, Jieneng, et al.
Veröffentlicht: (2024)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
von: Liu, Qihao, et al.
Veröffentlicht: (2025)
von: Liu, Qihao, et al.
Veröffentlicht: (2025)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
von: Xiao, Junfei, et al.
Veröffentlicht: (2023)
von: Xiao, Junfei, et al.
Veröffentlicht: (2023)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
von: Yang, Siwei, et al.
Veröffentlicht: (2024)
von: Yang, Siwei, et al.
Veröffentlicht: (2024)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
von: Yuille, Alan, et al.
Veröffentlicht: (2026)
von: Yuille, Alan, et al.
Veröffentlicht: (2026)
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
von: Yang, Timing, et al.
Veröffentlicht: (2025)
von: Yang, Timing, et al.
Veröffentlicht: (2025)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
von: Wang, Feng, et al.
Veröffentlicht: (2024)
von: Wang, Feng, et al.
Veröffentlicht: (2024)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
von: Wang, Feng, et al.
Veröffentlicht: (2025)
von: Wang, Feng, et al.
Veröffentlicht: (2025)
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
von: Lew, Jaihyun, et al.
Veröffentlicht: (2024)
von: Lew, Jaihyun, et al.
Veröffentlicht: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
von: Zhang, Siyu, et al.
Veröffentlicht: (2023)
von: Zhang, Siyu, et al.
Veröffentlicht: (2023)
Computer Vision with a Superpixelation Camera
von: Mahalingam, Sasidharan, et al.
Veröffentlicht: (2026)
von: Mahalingam, Sasidharan, et al.
Veröffentlicht: (2026)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
Frequency-Aware Flow Matching for High-Quality Image Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2026)
von: Ren, Sucheng, et al.
Veröffentlicht: (2026)
Scaling White-Box Transformers for Vision
von: Yang, Jinrui, et al.
Veröffentlicht: (2024)
von: Yang, Jinrui, et al.
Veröffentlicht: (2024)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
von: Liu, Haoyu, et al.
Veröffentlicht: (2026)
von: Liu, Haoyu, et al.
Veröffentlicht: (2026)
STENet: Superpixel Token Enhancing Network for RGB-D Salient Object Detection
von: Chen, Jianlin, et al.
Veröffentlicht: (2026)
von: Chen, Jianlin, et al.
Veröffentlicht: (2026)
Captain Safari: A World Engine with Pose-Aligned 3D Memory
von: Chou, Yu-Cheng, et al.
Veröffentlicht: (2025)
von: Chou, Yu-Cheng, et al.
Veröffentlicht: (2025)
Representation Learning with Adaptive Superpixel Coding
von: Khalil, Mahmoud, et al.
Veröffentlicht: (2025)
von: Khalil, Mahmoud, et al.
Veröffentlicht: (2025)
Square Superpixel Generation and Representation Learning via Granular Ball Computing
von: Xia, Shuyin, et al.
Veröffentlicht: (2026)
von: Xia, Shuyin, et al.
Veröffentlicht: (2026)
Gaussian Scenes: Pose-Free Sparse-View Scene Reconstruction using Depth-Enhanced Diffusion Priors
von: Paul, Soumava, et al.
Veröffentlicht: (2024)
von: Paul, Soumava, et al.
Veröffentlicht: (2024)
Superpixel-informed Implicit Neural Representation for Multi-Dimensional Data
von: Li, Jiayi, et al.
Veröffentlicht: (2024)
von: Li, Jiayi, et al.
Veröffentlicht: (2024)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
von: He, Ju, et al.
Veröffentlicht: (2023)
von: He, Ju, et al.
Veröffentlicht: (2023)
Large Language Models are Universal Reasoners for Visual Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2026)
von: Ren, Sucheng, et al.
Veröffentlicht: (2026)
Joint Superpixel and Self-Representation Learning for Scalable Hyperspectral Image Clustering
von: Li, Xianlu, et al.
Veröffentlicht: (2025)
von: Li, Xianlu, et al.
Veröffentlicht: (2025)
Deep Spherical Superpixels
von: Giraud, Rémi, et al.
Veröffentlicht: (2024)
von: Giraud, Rémi, et al.
Veröffentlicht: (2024)
CRAVES: Controlling Robotic Arm with a Vision-based Economic System
von: Zuo, Yiming, et al.
Veröffentlicht: (2018)
von: Zuo, Yiming, et al.
Veröffentlicht: (2018)
Quality Sentinel: Estimating Label Quality and Errors in Medical Segmentation Datasets
von: Chen, Yixiong, et al.
Veröffentlicht: (2024)
von: Chen, Yixiong, et al.
Veröffentlicht: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
von: Li, Xianhang, et al.
Veröffentlicht: (2025)
von: Li, Xianhang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
von: Xie, Yunfei, et al.
Veröffentlicht: (2024) -
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
von: Wang, Feng, et al.
Veröffentlicht: (2023) -
Mamba-R: Vision Mamba ALSO Needs Registers
von: Wang, Feng, et al.
Veröffentlicht: (2024) -
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
von: Li, Zhuowan, et al.
Veröffentlicht: (2022) -
ViT-5: Vision Transformers for The Mid-2020s
von: Wang, Feng, et al.
Veröffentlicht: (2026)