UniFormer: Unifying Convolution and Self-attention for Visual Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Kunchang, Wang, Yali, Zhang, Junhao, Gao, Peng, Song, Guanglu, Liu, Yu, Li, Hongsheng, Qiao, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2022
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
von: Chen, Boyu, et al.
Veröffentlicht: (2024)
von: Chen, Boyu, et al.
Veröffentlicht: (2024)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
von: Liu, Jie, et al.
Veröffentlicht: (2026)
von: Liu, Jie, et al.
Veröffentlicht: (2026)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
von: Guo, Yiwei, et al.
Veröffentlicht: (2024)
von: Guo, Yiwei, et al.
Veröffentlicht: (2024)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
von: Zhao, Lei, et al.
Veröffentlicht: (2025)
von: Zhao, Lei, et al.
Veröffentlicht: (2025)
Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
von: Ma, Bingqi, et al.
Veröffentlicht: (2024)
von: Ma, Bingqi, et al.
Veröffentlicht: (2024)
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
UniForm: A Reuse Attention Mechanism Optimized for Efficient Vision Transformers on Edge Devices
von: Yeom, Seul-Ki, et al.
Veröffentlicht: (2024)
von: Yeom, Seul-Ki, et al.
Veröffentlicht: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
von: Li, Kunchang, et al.
Veröffentlicht: (2024)
von: Li, Kunchang, et al.
Veröffentlicht: (2024)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
von: Shao, Hao, et al.
Veröffentlicht: (2024)
von: Shao, Hao, et al.
Veröffentlicht: (2024)
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
von: Zhang, Yabo, et al.
Veröffentlicht: (2026)
von: Zhang, Yabo, et al.
Veröffentlicht: (2026)
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
von: Li, Yu, et al.
Veröffentlicht: (2025)
von: Li, Yu, et al.
Veröffentlicht: (2025)
Harvest Video Foundation Models via Efficient Post-Pretraining
von: Li, Yizhuo, et al.
Veröffentlicht: (2023)
von: Li, Yizhuo, et al.
Veröffentlicht: (2023)
Low-Resolution Action Recognition for Tiny Actions Challenge
von: Chen, Boyu, et al.
Veröffentlicht: (2022)
von: Chen, Boyu, et al.
Veröffentlicht: (2022)
SeaFormer++: Squeeze-enhanced Axial Transformer for Mobile Visual Recognition
von: Wan, Qiang, et al.
Veröffentlicht: (2023)
von: Wan, Qiang, et al.
Veröffentlicht: (2023)
FouriScale: A Frequency Perspective on Training-Free High-Resolution Image Synthesis
von: Huang, Linjiang, et al.
Veröffentlicht: (2024)
von: Huang, Linjiang, et al.
Veröffentlicht: (2024)
A Visual Self-attention Mechanism Facial Expression Recognition Network beyond Convnext
von: Nan, Bingyu, et al.
Veröffentlicht: (2025)
von: Nan, Bingyu, et al.
Veröffentlicht: (2025)
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
von: Zheng, Dian, et al.
Veröffentlicht: (2026)
von: Zheng, Dian, et al.
Veröffentlicht: (2026)
Attentive Convolution: Unifying the Expressivity of Self-Attention with Convolutional Efficiency
von: Yu, Hao, et al.
Veröffentlicht: (2025)
von: Yu, Hao, et al.
Veröffentlicht: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
Uni-Animator: Towards Unified Visual Colorization
von: Chen, Xinyuan, et al.
Veröffentlicht: (2026)
von: Chen, Xinyuan, et al.
Veröffentlicht: (2026)
UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual Recognition
von: Nan, Xinyu, et al.
Veröffentlicht: (2025)
von: Nan, Xinyu, et al.
Veröffentlicht: (2025)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
von: Li, Teng, et al.
Veröffentlicht: (2025)
von: Li, Teng, et al.
Veröffentlicht: (2025)
UniComp: Rethinking Video Compression Through Informational Uniqueness
von: Yuan, Chao, et al.
Veröffentlicht: (2025)
von: Yuan, Chao, et al.
Veröffentlicht: (2025)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
von: Yue, Zhengrong, et al.
Veröffentlicht: (2025)
von: Yue, Zhengrong, et al.
Veröffentlicht: (2025)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
von: Wang, Zun, et al.
Veröffentlicht: (2024)
von: Wang, Zun, et al.
Veröffentlicht: (2024)
UniPAR: A Unified Framework for Pedestrian Attribute Recognition
von: Xu, Minghe, et al.
Veröffentlicht: (2026)
von: Xu, Minghe, et al.
Veröffentlicht: (2026)
Vlogger: Make Your Dream A Vlog
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2024)
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2024)
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
von: He, Dailan, et al.
Veröffentlicht: (2026)
von: He, Dailan, et al.
Veröffentlicht: (2026)
EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM
von: Zong, Zhuofan, et al.
Veröffentlicht: (2024)
von: Zong, Zhuofan, et al.
Veröffentlicht: (2024)
MoVA: Adapting Mixture of Vision Experts to Multimodal Context
von: Zong, Zhuofan, et al.
Veröffentlicht: (2024)
von: Zong, Zhuofan, et al.
Veröffentlicht: (2024)
High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning
von: He, Dailan, et al.
Veröffentlicht: (2025)
von: He, Dailan, et al.
Veröffentlicht: (2025)
OV-Uni3DETR: Towards Unified Open-Vocabulary 3D Object Detection via Cycle-Modality Propagation
von: Wang, Zhenyu, et al.
Veröffentlicht: (2024)
von: Wang, Zhenyu, et al.
Veröffentlicht: (2024)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
von: Wang, Jinting, et al.
Veröffentlicht: (2025)
von: Wang, Jinting, et al.
Veröffentlicht: (2025)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
von: Ma, Chuofan, et al.
Veröffentlicht: (2025)
von: Ma, Chuofan, et al.
Veröffentlicht: (2025)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
von: Liu, Qingyang, et al.
Veröffentlicht: (2026)
von: Liu, Qingyang, et al.
Veröffentlicht: (2026)
UniSync: A Unified Framework for Audio-Visual Synchronization
von: Feng, Tao, et al.
Veröffentlicht: (2025)
von: Feng, Tao, et al.
Veröffentlicht: (2025)
Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific Adaptation
von: Wang, Fu-Yun, et al.
Veröffentlicht: (2024)
von: Wang, Fu-Yun, et al.
Veröffentlicht: (2024)
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
von: Cao, Shuo, et al.
Veröffentlicht: (2025)
von: Cao, Shuo, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
von: Chen, Boyu, et al.
Veröffentlicht: (2024) -
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
von: Liu, Jie, et al.
Veröffentlicht: (2026) -
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
von: Guo, Yiwei, et al.
Veröffentlicht: (2024) -
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
von: Zhao, Lei, et al.
Veröffentlicht: (2025) -
Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
von: Ma, Bingqi, et al.
Veröffentlicht: (2024)