CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Linhui, Yang, Xiaoshan, Peng, Fang, Yan, Ming, Wang, Yaowei, Xu, Changsheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
Towards Visual Grounding: A Survey
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
di: Gao, Bin-Bin, et al.
Pubblicazione: (2025)
di: Gao, Bin-Bin, et al.
Pubblicazione: (2025)
MediCLIP: Adapting CLIP for Few-shot Medical Image Anomaly Detection
di: Zhang, Ximiao, et al.
Pubblicazione: (2024)
di: Zhang, Ximiao, et al.
Pubblicazione: (2024)
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
di: Zhu, Wenqi, et al.
Pubblicazione: (2024)
di: Zhu, Wenqi, et al.
Pubblicazione: (2024)
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
di: Singha, Mainak, et al.
Pubblicazione: (2023)
di: Singha, Mainak, et al.
Pubblicazione: (2023)
CLIP-based Synergistic Knowledge Transfer for Text-based Person Retrieval
di: Liu, Yating, et al.
Pubblicazione: (2023)
di: Liu, Yating, et al.
Pubblicazione: (2023)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC
di: Hu, Guanyu, et al.
Pubblicazione: (2025)
di: Hu, Guanyu, et al.
Pubblicazione: (2025)
AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly Detection
di: Cao, Yunkang, et al.
Pubblicazione: (2024)
di: Cao, Yunkang, et al.
Pubblicazione: (2024)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
di: Dai, Ming, et al.
Pubblicazione: (2024)
di: Dai, Ming, et al.
Pubblicazione: (2024)
WP-CLIP: Leveraging CLIP to Predict Wölfflin's Principles in Visual Art
di: Ghildyal, Abhijay, et al.
Pubblicazione: (2025)
di: Ghildyal, Abhijay, et al.
Pubblicazione: (2025)
LiteEmbed: Adapting CLIP to Rare Classes
di: Agarwal, Aishwarya, et al.
Pubblicazione: (2026)
di: Agarwal, Aishwarya, et al.
Pubblicazione: (2026)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
di: Liu, Mushui, et al.
Pubblicazione: (2024)
di: Liu, Mushui, et al.
Pubblicazione: (2024)
CLIP-KD: An Empirical Study of CLIP Model Distillation
di: Yang, Chuanguang, et al.
Pubblicazione: (2023)
di: Yang, Chuanguang, et al.
Pubblicazione: (2023)
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
CLIP Brings Better Features to Visual Aesthetics Learners
di: Xu, Liwu, et al.
Pubblicazione: (2023)
di: Xu, Liwu, et al.
Pubblicazione: (2023)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
di: Giahi, Ramin, et al.
Pubblicazione: (2025)
di: Giahi, Ramin, et al.
Pubblicazione: (2025)
CLIP-AGIQA: Boosting the Performance of AI-Generated Image Quality Assessment with CLIP
di: Tang, Zhenchen, et al.
Pubblicazione: (2024)
di: Tang, Zhenchen, et al.
Pubblicazione: (2024)
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
di: Asgarov, Ali, et al.
Pubblicazione: (2024)
di: Asgarov, Ali, et al.
Pubblicazione: (2024)
CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering
di: Vardi, Ben, et al.
Pubblicazione: (2025)
di: Vardi, Ben, et al.
Pubblicazione: (2025)
Learning to Adapt Category Consistent Meta-Feature of CLIP for Few-Shot Classification
di: Shi, Jiaying, et al.
Pubblicazione: (2024)
di: Shi, Jiaying, et al.
Pubblicazione: (2024)
Pilot: Building the Federated Multimodal Instruction Tuning Framework
di: Xiong, Baochen, et al.
Pubblicazione: (2025)
di: Xiong, Baochen, et al.
Pubblicazione: (2025)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
di: Zheng, Minghang, et al.
Pubblicazione: (2024)
di: Zheng, Minghang, et al.
Pubblicazione: (2024)
StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and Completion
di: Tao, Ming, et al.
Pubblicazione: (2024)
di: Tao, Ming, et al.
Pubblicazione: (2024)
SuperCLIP: CLIP with Simple Classification Supervision
di: Zhao, Weiheng, et al.
Pubblicazione: (2025)
di: Zhao, Weiheng, et al.
Pubblicazione: (2025)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
di: Li, Fan, et al.
Pubblicazione: (2025)
di: Li, Fan, et al.
Pubblicazione: (2025)
AF-CLIP: Zero-Shot Anomaly Detection via Anomaly-Focused CLIP Adaptation
di: Fang, Qingqing, et al.
Pubblicazione: (2025)
di: Fang, Qingqing, et al.
Pubblicazione: (2025)
Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding
di: Mei, Guofeng, et al.
Pubblicazione: (2025)
di: Mei, Guofeng, et al.
Pubblicazione: (2025)
CLIP-SENet: CLIP-based Semantic Enhancement Network for Vehicle Re-identification
di: Lu, Liping, et al.
Pubblicazione: (2025)
di: Lu, Liping, et al.
Pubblicazione: (2025)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
Efficiently Disentangling CLIP for Multi-Object Perception
di: Rawlekar, Samyak, et al.
Pubblicazione: (2025)
di: Rawlekar, Samyak, et al.
Pubblicazione: (2025)
CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation
di: Chung, Jeannie, et al.
Pubblicazione: (2026)
di: Chung, Jeannie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024) -
Towards Visual Grounding: A Survey
di: Xiao, Linhui, et al.
Pubblicazione: (2024) -
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
di: Xiao, Linhui, et al.
Pubblicazione: (2024) -
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
di: Gao, Bin-Bin, et al.
Pubblicazione: (2025) -
MediCLIP: Adapting CLIP for Few-shot Medical Image Anomaly Detection
di: Zhang, Ximiao, et al.
Pubblicazione: (2024)