RMT: Retentive Networks Meet Vision Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Fan, Qihang, Huang, Huaibo, Chen, Mingrui, Liu, Hongmin, He, Ran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Advancing Vision Transformer with Enhanced Spatial Priors
por: Fan, Qihang, et al.
Publicado: (2026)
por: Fan, Qihang, et al.
Publicado: (2026)
Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
Lightweight Vision Transformer with Bidirectional Interaction
por: Fan, Qihang, et al.
Publicado: (2023)
por: Fan, Qihang, et al.
Publicado: (2023)
Vision Transformer with Sparse Scan Prior
por: Zhang, Yuguang, et al.
Publicado: (2024)
por: Zhang, Yuguang, et al.
Publicado: (2024)
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2026)
por: Fan, Qihang, et al.
Publicado: (2026)
Breaking the Low-Rank Dilemma of Linear Attention
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
Rectifying Magnitude Neglect in Linear Attention
por: Fan, Qihang, et al.
Publicado: (2025)
por: Fan, Qihang, et al.
Publicado: (2025)
ViTAR: Vision Transformer with Any Resolution
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
Breaking Complexity Barriers: High-Resolution Image Restoration with Rank Enhanced Linear Attention
por: Ai, Yuang, et al.
Publicado: (2025)
por: Ai, Yuang, et al.
Publicado: (2025)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
por: Chen, Mingrui, et al.
Publicado: (2026)
por: Chen, Mingrui, et al.
Publicado: (2026)
Vision Transformer with Super Token Sampling
por: Huang, Huaibo, et al.
Publicado: (2022)
por: Huang, Huaibo, et al.
Publicado: (2022)
DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
por: Ai, Yuang, et al.
Publicado: (2025)
por: Ai, Yuang, et al.
Publicado: (2025)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
por: Chen, Mingrui, et al.
Publicado: (2025)
por: Chen, Mingrui, et al.
Publicado: (2025)
Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
por: Ge, Shiran, et al.
Publicado: (2025)
por: Ge, Shiran, et al.
Publicado: (2025)
LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration
por: Ai, Yuang, et al.
Publicado: (2024)
por: Ai, Yuang, et al.
Publicado: (2024)
ZePo: Zero-Shot Portrait Stylization with Faster Sampling
por: Liu, Jin, et al.
Publicado: (2024)
por: Liu, Jin, et al.
Publicado: (2024)
Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation Transformer
por: Ai, Yuang, et al.
Publicado: (2023)
por: Ai, Yuang, et al.
Publicado: (2023)
DeVAn: Dense Video Annotation for Video-Language Models
por: Liu, Tingkai, et al.
Publicado: (2023)
por: Liu, Tingkai, et al.
Publicado: (2023)
NOFT: Test-Time Noise Finetune via Information Bottleneck for Highly Correlated Asset Creation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Multimodal Prompt Perceiver: Empower Adaptiveness, Generalizability and Fidelity for All-in-One Image Restoration
por: Ai, Yuang, et al.
Publicado: (2023)
por: Ai, Yuang, et al.
Publicado: (2023)
Marmot: Object-Level Self-Correction via Multi-Agent Reasoning
por: Sun, Jiayang, et al.
Publicado: (2025)
por: Sun, Jiayang, et al.
Publicado: (2025)
InfoBFR: Real-World Blind Face Restoration via Information Bottleneck
por: Gao, Nan, et al.
Publicado: (2025)
por: Gao, Nan, et al.
Publicado: (2025)
Parallel Augmentation and Dual Enhancement for Occluded Person Re-identification
por: Wang, Zi, et al.
Publicado: (2022)
por: Wang, Zi, et al.
Publicado: (2022)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
por: Bai, Purui, et al.
Publicado: (2026)
por: Bai, Purui, et al.
Publicado: (2026)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
por: Han, Xiaotian, et al.
Publicado: (2024)
por: Han, Xiaotian, et al.
Publicado: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
por: Liu, Haogeng, et al.
Publicado: (2024)
por: Liu, Haogeng, et al.
Publicado: (2024)
Prototypical Distillation and Debiased Tuning for Black-box Unsupervised Domain Adaptation
por: Liang, Jian, et al.
Publicado: (2024)
por: Liang, Jian, et al.
Publicado: (2024)
DiffMAC: Diffusion Manifold Hallucination Correction for High Generalization Blind Face Restoration
por: Gao, Nan, et al.
Publicado: (2024)
por: Gao, Nan, et al.
Publicado: (2024)
Diffusion Transformer Meets Random Masks: An Advanced PET Reconstruction Framework
por: Huang, Bin, et al.
Publicado: (2025)
por: Huang, Bin, et al.
Publicado: (2025)
Attention Retention for Continual Learning with Vision Transformers
por: Lu, Yue, et al.
Publicado: (2026)
por: Lu, Yue, et al.
Publicado: (2026)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
por: Liu, Qihao, et al.
Publicado: (2025)
por: Liu, Qihao, et al.
Publicado: (2025)
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
por: Zou, Yueying, et al.
Publicado: (2025)
por: Zou, Yueying, et al.
Publicado: (2025)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?
por: Zou, Yueying, et al.
Publicado: (2026)
por: Zou, Yueying, et al.
Publicado: (2026)
ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding
por: Peng, Qihang, et al.
Publicado: (2025)
por: Peng, Qihang, et al.
Publicado: (2025)
Source-Free Domain Adaptive Semantic Segmentation of Remote Sensing Images with Diffusion-Guided Label Enrichment
por: Liu, Wenjie, et al.
Publicado: (2025)
por: Liu, Wenjie, et al.
Publicado: (2025)
Length Matters: Length-Aware Transformer for Temporal Sentence Grounding
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
ID-Cloak: Crafting Identity-Specific Cloaks Against Personalized Text-to-Image Generation
por: Teng, Qianrui, et al.
Publicado: (2025)
por: Teng, Qianrui, et al.
Publicado: (2025)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
por: Liu, Xuannan, et al.
Publicado: (2025)
por: Liu, Xuannan, et al.
Publicado: (2025)
RMT-BVQA: Recurrent Memory Transformer-based Blind Video Quality Assessment for Enhanced Video Content
por: Peng, Tianhao, et al.
Publicado: (2024)
por: Peng, Tianhao, et al.
Publicado: (2024)
Ejemplares similares
-
Advancing Vision Transformer with Enhanced Spatial Priors
por: Fan, Qihang, et al.
Publicado: (2026) -
Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2024) -
Lightweight Vision Transformer with Bidirectional Interaction
por: Fan, Qihang, et al.
Publicado: (2023) -
Vision Transformer with Sparse Scan Prior
por: Zhang, Yuguang, et al.
Publicado: (2024) -
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
por: Fan, Qihang, et al.
Publicado: (2026)