MoCLIP-Lite: Efficient Video Recognition by Fusing CLIP with Motion Vectors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Binhua, Wang, Ni, Pakrashi, Arjun, Dev, Soumyabrata |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MVP: Motion Vector Propagation for Zero-Shot Video Object Detection
par: Huang, Binhua, et autres
Publié: (2025)
par: Huang, Binhua, et autres
Publié: (2025)
MoCLIP: Motion-Aware Fine-Tuning and Distillation of CLIP for Human Motion Generation
par: Maldonado, Gabriel, et autres
Publié: (2025)
par: Maldonado, Gabriel, et autres
Publié: (2025)
MoCrop: Training Free Motion Guided Cropping for Efficient Video Action Recognition
par: Huang, Binhua, et autres
Publié: (2025)
par: Huang, Binhua, et autres
Publié: (2025)
Multi-modal Spatio-Temporal Transformer for High-resolution Land Subsidence Prediction
par: Yao, Wendong, et autres
Publié: (2025)
par: Yao, Wendong, et autres
Publié: (2025)
A multimodal Transformer for InSAR-based ground deformation forecasting with cross-site generalization across Europe
par: Yao, Wendong, et autres
Publié: (2025)
par: Yao, Wendong, et autres
Publié: (2025)
LiteEmbed: Adapting CLIP to Rare Classes
par: Agarwal, Aishwarya, et autres
Publié: (2026)
par: Agarwal, Aishwarya, et autres
Publié: (2026)
CLIP-SLA: Parameter-Efficient CLIP Adaptation for Continuous Sign Language Recognition
par: Alyami, Sarah, et autres
Publié: (2025)
par: Alyami, Sarah, et autres
Publié: (2025)
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
EZ-CLIP: Efficient Zeroshot Video Action Recognition
par: Ahmad, Shahzad, et autres
Publié: (2023)
par: Ahmad, Shahzad, et autres
Publié: (2023)
A Deep Learning Approach for Spatio-Temporal Forecasting of InSAR Ground Deformation in Eastern Ireland
par: Yao, Wendong, et autres
Publié: (2025)
par: Yao, Wendong, et autres
Publié: (2025)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
VTD-CLIP: Video-to-Text Discretization via Prompting CLIP
par: Zhu, Wencheng, et autres
Publié: (2025)
par: Zhu, Wencheng, et autres
Publié: (2025)
SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels
par: Singh, Darshan, et autres
Publié: (2024)
par: Singh, Darshan, et autres
Publié: (2024)
AnimalMotionCLIP: Embedding motion in CLIP for Animal Behavior Analysis
par: Zhong, Enmin, et autres
Publié: (2025)
par: Zhong, Enmin, et autres
Publié: (2025)
SuperCLIP: CLIP with Simple Classification Supervision
par: Zhao, Weiheng, et autres
Publié: (2025)
par: Zhao, Weiheng, et autres
Publié: (2025)
CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression
par: Zhang, Kangjie, et autres
Publié: (2026)
par: Zhang, Kangjie, et autres
Publié: (2026)
MV-CLIP: Multi-View CLIP for Zero-shot 3D Shape Recognition
par: Song, Dan, et autres
Publié: (2023)
par: Song, Dan, et autres
Publié: (2023)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
par: Zhu, Wenqi, et autres
Publié: (2024)
par: Zhu, Wenqi, et autres
Publié: (2024)
CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation
par: Chung, Jeannie, et autres
Publié: (2026)
par: Chung, Jeannie, et autres
Publié: (2026)
Emotion Recognition with CLIP and Sequential Learning
par: Zhou, Weiwei, et autres
Publié: (2025)
par: Zhou, Weiwei, et autres
Publié: (2025)
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
par: Yang, Kaicheng, et autres
Publié: (2024)
par: Yang, Kaicheng, et autres
Publié: (2024)
MobileViCLIP: An Efficient Video-Text Model for Mobile Devices
par: Yang, Min, et autres
Publié: (2025)
par: Yang, Min, et autres
Publié: (2025)
CLIP-KD: An Empirical Study of CLIP Model Distillation
par: Yang, Chuanguang, et autres
Publié: (2023)
par: Yang, Chuanguang, et autres
Publié: (2023)
Cattle-CLIP: A Multimodal Framework for Cattle Behaviour Recognition from Video
par: Liu, Huimin, et autres
Publié: (2025)
par: Liu, Huimin, et autres
Publié: (2025)
CLIP-Mamba: CLIP Pretrained Mamba Models with OOD and Hessian Evaluation
par: Huang, Weiquan, et autres
Publié: (2024)
par: Huang, Weiquan, et autres
Publié: (2024)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
par: Zhang, Beichen, et autres
Publié: (2024)
par: Zhang, Beichen, et autres
Publié: (2024)
Leveraging CLIP Encoder for Multimodal Emotion Recognition
par: Song, Yehun, et autres
Publié: (2025)
par: Song, Yehun, et autres
Publié: (2025)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
par: Wang, Mengmeng, et autres
Publié: (2024)
par: Wang, Mengmeng, et autres
Publié: (2024)
CardiacCLIP: Video-based CLIP Adaptation for LVEF Prediction in a Few-shot Manner
par: Du, Yao, et autres
Publié: (2025)
par: Du, Yao, et autres
Publié: (2025)
CLIP model is an Efficient Online Lifelong Learner
par: Wang, Leyuan, et autres
Publié: (2024)
par: Wang, Leyuan, et autres
Publié: (2024)
EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges
par: Jon, Hyo Jin, et autres
Publié: (2026)
par: Jon, Hyo Jin, et autres
Publié: (2026)
Incremental Object Detection with CLIP
par: Huang, Ziyue, et autres
Publié: (2023)
par: Huang, Ziyue, et autres
Publié: (2023)
CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling
par: Zhang, Jihai, et autres
Publié: (2024)
par: Zhang, Jihai, et autres
Publié: (2024)
Simba: Mamba augmented U-ShiftGCN for Skeletal Action Recognition in Videos
par: Chaudhuri, Soumyabrata, et autres
Publié: (2024)
par: Chaudhuri, Soumyabrata, et autres
Publié: (2024)
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition
par: Ning, Shan, et autres
Publié: (2026)
par: Ning, Shan, et autres
Publié: (2026)
IPAD-CLIP: Teaching CLIP to Detect Image Local Perceptual Artifacts
par: Wang, Juan, et autres
Publié: (2026)
par: Wang, Juan, et autres
Publié: (2026)
Rethinking CLIP-based Video Learners in Cross-Domain Open-Vocabulary Action Recognition
par: Lin, Kun-Yu, et autres
Publié: (2024)
par: Lin, Kun-Yu, et autres
Publié: (2024)
ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation
par: Wang, Jingyun, et autres
Publié: (2024)
par: Wang, Jingyun, et autres
Publié: (2024)
Robust Light-Weight Facial Affective Behavior Recognition with CLIP
par: Lin, Li, et autres
Publié: (2024)
par: Lin, Li, et autres
Publié: (2024)
Documents similaires
-
MVP: Motion Vector Propagation for Zero-Shot Video Object Detection
par: Huang, Binhua, et autres
Publié: (2025) -
MoCLIP: Motion-Aware Fine-Tuning and Distillation of CLIP for Human Motion Generation
par: Maldonado, Gabriel, et autres
Publié: (2025) -
MoCrop: Training Free Motion Guided Cropping for Efficient Video Action Recognition
par: Huang, Binhua, et autres
Publié: (2025) -
Multi-modal Spatio-Temporal Transformer for High-resolution Land Subsidence Prediction
par: Yao, Wendong, et autres
Publié: (2025) -
A multimodal Transformer for InSAR-based ground deformation forecasting with cross-site generalization across Europe
par: Yao, Wendong, et autres
Publié: (2025)