Vision Transformer with Super Token Sampling
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Huaibo, Zhou, Xiaoqiang, Cao, Jie, He, Ran, Tan, Tieniu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Lightweight Vision Transformer with Bidirectional Interaction
por: Fan, Qihang, et al.
Publicado: (2023)
por: Fan, Qihang, et al.
Publicado: (2023)
Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation Transformer
por: Ai, Yuang, et al.
Publicado: (2023)
por: Ai, Yuang, et al.
Publicado: (2023)
ZePo: Zero-Shot Portrait Stylization with Faster Sampling
por: Liu, Jin, et al.
Publicado: (2024)
por: Liu, Jin, et al.
Publicado: (2024)
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2026)
por: Fan, Qihang, et al.
Publicado: (2026)
Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
Multimodal Prompt Perceiver: Empower Adaptiveness, Generalizability and Fidelity for All-in-One Image Restoration
por: Ai, Yuang, et al.
Publicado: (2023)
por: Ai, Yuang, et al.
Publicado: (2023)
RMT: Retentive Networks Meet Vision Transformers
por: Fan, Qihang, et al.
Publicado: (2023)
por: Fan, Qihang, et al.
Publicado: (2023)
Advancing Vision Transformer with Enhanced Spatial Priors
por: Fan, Qihang, et al.
Publicado: (2026)
por: Fan, Qihang, et al.
Publicado: (2026)
Vision Transformer with Sparse Scan Prior
por: Zhang, Yuguang, et al.
Publicado: (2024)
por: Zhang, Yuguang, et al.
Publicado: (2024)
Marmot: Object-Level Self-Correction via Multi-Agent Reasoning
por: Sun, Jiayang, et al.
Publicado: (2025)
por: Sun, Jiayang, et al.
Publicado: (2025)
Breaking the Low-Rank Dilemma of Linear Attention
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration
por: Ai, Yuang, et al.
Publicado: (2024)
por: Ai, Yuang, et al.
Publicado: (2024)
ViTAR: Vision Transformer with Any Resolution
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
por: Sheng, Lijun, et al.
Publicado: (2025)
por: Sheng, Lijun, et al.
Publicado: (2025)
A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts
por: Liang, Jian, et al.
Publicado: (2023)
por: Liang, Jian, et al.
Publicado: (2023)
Rectifying Magnitude Neglect in Linear Attention
por: Fan, Qihang, et al.
Publicado: (2025)
por: Fan, Qihang, et al.
Publicado: (2025)
NOFT: Test-Time Noise Finetune via Information Bottleneck for Highly Correlated Asset Creation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Towards Compatible Fine-tuning for Vision-Language Model Updates
por: Wang, Zhengbo, et al.
Publicado: (2024)
por: Wang, Zhengbo, et al.
Publicado: (2024)
Connecting the Dots: Collaborative Fine-tuning for Black-Box Vision-Language Models
por: Wang, Zhengbo, et al.
Publicado: (2024)
por: Wang, Zhengbo, et al.
Publicado: (2024)
Parallel Augmentation and Dual Enhancement for Occluded Person Re-identification
por: Wang, Zi, et al.
Publicado: (2022)
por: Wang, Zi, et al.
Publicado: (2022)
Breaking Complexity Barriers: High-Resolution Image Restoration with Rank Enhanced Linear Attention
por: Ai, Yuang, et al.
Publicado: (2025)
por: Ai, Yuang, et al.
Publicado: (2025)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
por: Chen, Mingrui, et al.
Publicado: (2026)
por: Chen, Mingrui, et al.
Publicado: (2026)
InfoBFR: Real-World Blind Face Restoration via Information Bottleneck
por: Gao, Nan, et al.
Publicado: (2025)
por: Gao, Nan, et al.
Publicado: (2025)
Learning the Degradation Distribution for Blind Image Super-Resolution
por: Luo, Zhengxiong, et al.
Publicado: (2022)
por: Luo, Zhengxiong, et al.
Publicado: (2022)
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
por: Ai, Yuang, et al.
Publicado: (2024)
por: Ai, Yuang, et al.
Publicado: (2024)
Realistic Unsupervised CLIP Fine-tuning with Universal Entropy Optimization
por: Liang, Jian, et al.
Publicado: (2023)
por: Liang, Jian, et al.
Publicado: (2023)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
por: Chen, Mingrui, et al.
Publicado: (2025)
por: Chen, Mingrui, et al.
Publicado: (2025)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
por: Bai, Purui, et al.
Publicado: (2026)
por: Bai, Purui, et al.
Publicado: (2026)
DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
por: Ai, Yuang, et al.
Publicado: (2025)
por: Ai, Yuang, et al.
Publicado: (2025)
Context-Aware Token Selection and Packing for Enhanced Vision Transformer
por: Zhang, Tianyi, et al.
Publicado: (2024)
por: Zhang, Tianyi, et al.
Publicado: (2024)
Exploring Vacant Classes in Label-Skewed Federated Learning
por: Guo, Kuangpu, et al.
Publicado: (2024)
por: Guo, Kuangpu, et al.
Publicado: (2024)
DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers
por: He, Kaixuan, et al.
Publicado: (2026)
por: He, Kaixuan, et al.
Publicado: (2026)
Transcending the Limit of Local Window: Advanced Super-Resolution Transformer with Adaptive Token Dictionary
por: Zhang, Leheng, et al.
Publicado: (2024)
por: Zhang, Leheng, et al.
Publicado: (2024)
DiffMAC: Diffusion Manifold Hallucination Correction for High Generalization Blind Face Restoration
por: Gao, Nan, et al.
Publicado: (2024)
por: Gao, Nan, et al.
Publicado: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
por: Liu, Haogeng, et al.
Publicado: (2024)
por: Liu, Haogeng, et al.
Publicado: (2024)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
por: Peng, Shuai, et al.
Publicado: (2024)
por: Peng, Shuai, et al.
Publicado: (2024)
Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
por: Ge, Shiran, et al.
Publicado: (2025)
por: Ge, Shiran, et al.
Publicado: (2025)
SPoT: Subpixel Placement of Tokens in Vision Transformers
por: Hjelkrem-Tan, Martine, et al.
Publicado: (2025)
por: Hjelkrem-Tan, Martine, et al.
Publicado: (2025)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
por: Jin, Yang, et al.
Publicado: (2023)
por: Jin, Yang, et al.
Publicado: (2023)
Human Image Generation: A Comprehensive Survey
por: Jia, Zhen, et al.
Publicado: (2022)
por: Jia, Zhen, et al.
Publicado: (2022)
Ejemplares similares
-
Lightweight Vision Transformer with Bidirectional Interaction
por: Fan, Qihang, et al.
Publicado: (2023) -
Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation Transformer
por: Ai, Yuang, et al.
Publicado: (2023) -
ZePo: Zero-Shot Portrait Stylization with Faster Sampling
por: Liu, Jin, et al.
Publicado: (2024) -
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2026) -
Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2024)