OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Mushui, Li, Bozheng, Yu, Yunlong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fully Fine-tuned CLIP Models are Efficient Few-Shot Learners
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action Recognition
par: Li, Bozheng, et autres
Publié: (2024)
par: Li, Bozheng, et autres
Publié: (2024)
Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
par: Zhu, Wenqi, et autres
Publié: (2024)
par: Zhu, Wenqi, et autres
Publié: (2024)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
par: Xu, Jingqi
Publié: (2026)
par: Xu, Jingqi
Publié: (2026)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
par: Yao, Jiali, et autres
Publié: (2025)
par: Yao, Jiali, et autres
Publié: (2025)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2025)
par: Gao, Bin-Bin, et autres
Publié: (2025)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
par: Wang, Mengmeng, et autres
Publié: (2024)
par: Wang, Mengmeng, et autres
Publié: (2024)
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
par: Singha, Mainak, et autres
Publié: (2023)
par: Singha, Mainak, et autres
Publié: (2023)
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
MoCLIP-Lite: Efficient Video Recognition by Fusing CLIP with Motion Vectors
par: Huang, Binhua, et autres
Publié: (2025)
par: Huang, Binhua, et autres
Publié: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
par: Xi, Dianbing, et autres
Publié: (2025)
par: Xi, Dianbing, et autres
Publié: (2025)
Learning to Adapt Category Consistent Meta-Feature of CLIP for Few-Shot Classification
par: Shi, Jiaying, et autres
Publié: (2024)
par: Shi, Jiaying, et autres
Publié: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2023)
par: Xiao, Linhui, et autres
Publié: (2023)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
par: Liang, Susan, et autres
Publié: (2026)
par: Liang, Susan, et autres
Publié: (2026)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
par: Wei, Yujie, et autres
Publié: (2026)
par: Wei, Yujie, et autres
Publié: (2026)
Hybrid Mask Generation for Infrared Small Target Detection with Single-Point Supervision
par: He, Weijie, et autres
Publié: (2024)
par: He, Weijie, et autres
Publié: (2024)
MediCLIP: Adapting CLIP for Few-shot Medical Image Anomaly Detection
par: Zhang, Ximiao, et autres
Publié: (2024)
par: Zhang, Ximiao, et autres
Publié: (2024)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
par: Zhao, Ruixiang, et autres
Publié: (2026)
par: Zhao, Ruixiang, et autres
Publié: (2026)
VTD-CLIP: Video-to-Text Discretization via Prompting CLIP
par: Zhu, Wencheng, et autres
Publié: (2025)
par: Zhu, Wencheng, et autres
Publié: (2025)
MV-CLIP: Multi-View CLIP for Zero-shot 3D Shape Recognition
par: Song, Dan, et autres
Publié: (2023)
par: Song, Dan, et autres
Publié: (2023)
Emotion Recognition with CLIP and Sequential Learning
par: Zhou, Weiwei, et autres
Publié: (2025)
par: Zhou, Weiwei, et autres
Publié: (2025)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
par: Zheng, Minghang, et autres
Publié: (2026)
par: Zheng, Minghang, et autres
Publié: (2026)
AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly Detection
par: Cao, Yunkang, et autres
Publié: (2024)
par: Cao, Yunkang, et autres
Publié: (2024)
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
par: Sun, Quan, et autres
Publié: (2024)
par: Sun, Quan, et autres
Publié: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
par: Zhang, Zilun, et autres
Publié: (2022)
par: Zhang, Zilun, et autres
Publié: (2022)
LiteEmbed: Adapting CLIP to Rare Classes
par: Agarwal, Aishwarya, et autres
Publié: (2026)
par: Agarwal, Aishwarya, et autres
Publié: (2026)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
par: Nawaz, Umair, et autres
Publié: (2024)
par: Nawaz, Umair, et autres
Publié: (2024)
Grid: Omni Visual Generation
par: Wan, Cong, et autres
Publié: (2024)
par: Wan, Cong, et autres
Publié: (2024)
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
par: He, Weijie, et autres
Publié: (2025)
par: He, Weijie, et autres
Publié: (2025)
OmniRe: Omni Urban Scene Reconstruction
par: Chen, Ziyu, et autres
Publié: (2024)
par: Chen, Ziyu, et autres
Publié: (2024)
BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIP
par: Bai, Jiawang, et autres
Publié: (2023)
par: Bai, Jiawang, et autres
Publié: (2023)
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
CLIP-SLA: Parameter-Efficient CLIP Adaptation for Continuous Sign Language Recognition
par: Alyami, Sarah, et autres
Publié: (2025)
par: Alyami, Sarah, et autres
Publié: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)
par: Wang, Chengyao, et autres
Publié: (2025)
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
par: Zhang, Guohui, et autres
Publié: (2026)
par: Zhang, Guohui, et autres
Publié: (2026)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
Documents similaires
-
Fully Fine-tuned CLIP Models are Efficient Few-Shot Learners
par: Liu, Mushui, et autres
Publié: (2024) -
Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action Recognition
par: Li, Bozheng, et autres
Publié: (2024) -
Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning
par: Liu, Mushui, et autres
Publié: (2024) -
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
par: Zhu, Wenqi, et autres
Publié: (2024) -
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
par: Xu, Jingqi
Publié: (2026)