CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Size, Zhang, Wenwei, Xu, Lumin, Jin, Sheng, Li, Xiangtai, Liu, Wentao, Loy, Chen Change |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
por: Xu, Shilin, et al.
Publicado: (2023)
por: Xu, Shilin, et al.
Publicado: (2023)
F-LMM: Grounding Frozen Large Multimodal Models
por: Wu, Size, et al.
Publicado: (2024)
por: Wu, Size, et al.
Publicado: (2024)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025)
por: Wu, Size, et al.
Publicado: (2025)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
por: Zhou, Chong, et al.
Publicado: (2023)
por: Zhou, Chong, et al.
Publicado: (2023)
OMG-Seg: Is One Model Good Enough For All Segmentation?
por: Li, Xiangtai, et al.
Publicado: (2024)
por: Li, Xiangtai, et al.
Publicado: (2024)
OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025)
por: Wu, Size, et al.
Publicado: (2025)
Transformer-Based Visual Segmentation: A Survey
por: Li, Xiangtai, et al.
Publicado: (2023)
por: Li, Xiangtai, et al.
Publicado: (2023)
Controllable Human-centric Keyframe Interpolation with Generative Prior
por: Guo, Zujin, et al.
Publicado: (2025)
por: Guo, Zujin, et al.
Publicado: (2025)
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
por: Xie, Jiahao, et al.
Publicado: (2023)
por: Xie, Jiahao, et al.
Publicado: (2023)
ATAS: Any-to-Any Self-Distillation for Enhanced Open-Vocabulary Dense Prediction
por: Yeo, Juan, et al.
Publicado: (2025)
por: Yeo, Juan, et al.
Publicado: (2025)
Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
por: Liao, Kang, et al.
Publicado: (2025)
por: Liao, Kang, et al.
Publicado: (2025)
TCFormer: Visual Recognition via Token Clustering Transformer
por: Zeng, Wang, et al.
Publicado: (2024)
por: Zeng, Wang, et al.
Publicado: (2024)
Rethinking CLIP-based Video Learners in Cross-Domain Open-Vocabulary Action Recognition
por: Lin, Kun-Yu, et al.
Publicado: (2024)
por: Lin, Kun-Yu, et al.
Publicado: (2024)
MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion Prior
por: Chen, Honghua, et al.
Publicado: (2024)
por: Chen, Honghua, et al.
Publicado: (2024)
UniFS: Universal Few-shot Instance Perception with Point Representations
por: Jin, Sheng, et al.
Publicado: (2024)
por: Jin, Sheng, et al.
Publicado: (2024)
Ultra-High Resolution Segmentation via Boundary-Enhanced Patch-Merging Transformer
por: Sun, Haopeng, et al.
Publicado: (2024)
por: Sun, Haopeng, et al.
Publicado: (2024)
DifFace: Blind Face Restoration with Diffused Error Contraction
por: Yue, Zongsheng, et al.
Publicado: (2022)
por: Yue, Zongsheng, et al.
Publicado: (2022)
Point-In-Context: Understanding Point Cloud via In-Context Learning
por: Liu, Mengyuan, et al.
Publicado: (2024)
por: Liu, Mengyuan, et al.
Publicado: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
por: Li, Xiaoming, et al.
Publicado: (2025)
por: Li, Xiaoming, et al.
Publicado: (2025)
Kalman-Inspired Feature Propagation for Video Face Super-Resolution
por: Feng, Ruicheng, et al.
Publicado: (2024)
por: Feng, Ruicheng, et al.
Publicado: (2024)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
por: Guo, Zujin, et al.
Publicado: (2024)
por: Guo, Zujin, et al.
Publicado: (2024)
AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation
por: Hou, Xinyu, et al.
Publicado: (2024)
por: Hou, Xinyu, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
MOWA: Multiple-in-One Image Warping Model
por: Liao, Kang, et al.
Publicado: (2024)
por: Liao, Kang, et al.
Publicado: (2024)
RecTok: Reconstruction Distillation along Rectified Flow
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
por: Li, Yunheng, et al.
Publicado: (2024)
por: Li, Yunheng, et al.
Publicado: (2024)
Unified Dense Prediction of Video Diffusion
por: Yang, Lehan, et al.
Publicado: (2025)
por: Yang, Lehan, et al.
Publicado: (2025)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
por: Zhang, Hao, et al.
Publicado: (2023)
por: Zhang, Hao, et al.
Publicado: (2023)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
The Detector Teaches Itself: Lightweight Self-Supervised Adaptation for Open-Vocabulary Object Detection
por: Wan, Yazhe, et al.
Publicado: (2026)
por: Wan, Yazhe, et al.
Publicado: (2026)
KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension
por: Yang, Jie, et al.
Publicado: (2024)
por: Yang, Jie, et al.
Publicado: (2024)
Learning 3D Garment Animation from Trajectories of A Piece of Cloth
por: Shao, Yidi, et al.
Publicado: (2025)
por: Shao, Yidi, et al.
Publicado: (2025)
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
LA-Sign: Looped Transformers with Geometry-aware Alignment for Skeleton-based Sign Language Recognition
por: Pu, Muxin, et al.
Publicado: (2026)
por: Pu, Muxin, et al.
Publicado: (2026)
GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image Recognition
por: Yao, Ruijie, et al.
Publicado: (2023)
por: Yao, Ruijie, et al.
Publicado: (2023)
Explore In-Context Segmentation via Latent Diffusion Models
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
por: Tai, Hanchen, et al.
Publicado: (2024)
por: Tai, Hanchen, et al.
Publicado: (2024)
3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation
por: Xiao, Zihao, et al.
Publicado: (2024)
por: Xiao, Zihao, et al.
Publicado: (2024)
ObjCtrl-2.5D: Training-free Object Control with Camera Poses
por: Wang, Zhouxia, et al.
Publicado: (2024)
por: Wang, Zhouxia, et al.
Publicado: (2024)
Ejemplares similares
-
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
por: Xu, Shilin, et al.
Publicado: (2023) -
F-LMM: Grounding Frozen Large Multimodal Models
por: Wu, Size, et al.
Publicado: (2024) -
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025) -
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
por: Yuan, Haobo, et al.
Publicado: (2024) -
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
por: Zhou, Chong, et al.
Publicado: (2023)