MobileViCLIP: An Efficient Video-Text Model for Mobile Devices
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Min, Jia, Zihan, Dai, Zhilin, Guo, Sheng, Wang, Limin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices
por: Zhao, Yang, et al.
Publicado: (2023)
por: Zhao, Yang, et al.
Publicado: (2023)
MoViE: Mobile Diffusion for Video Editing
por: Karjauv, Adil, et al.
Publicado: (2024)
por: Karjauv, Adil, et al.
Publicado: (2024)
RepViT: Revisiting Mobile CNN From ViT Perspective
por: Wang, Ao, et al.
Publicado: (2023)
por: Wang, Ao, et al.
Publicado: (2023)
MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices
por: Zhang, Shuai, et al.
Publicado: (2025)
por: Zhang, Shuai, et al.
Publicado: (2025)
Towards Real-time Video Compressive Sensing on Mobile Devices
por: Cao, Miao, et al.
Publicado: (2024)
por: Cao, Miao, et al.
Publicado: (2024)
AMC: AutoML for Model Compression and Acceleration on Mobile Devices
por: He, Yihui, et al.
Publicado: (2018)
por: He, Yihui, et al.
Publicado: (2018)
SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training
por: Hu, Dongting, et al.
Publicado: (2024)
por: Hu, Dongting, et al.
Publicado: (2024)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
por: Kim, Bosung, et al.
Publicado: (2025)
por: Kim, Bosung, et al.
Publicado: (2025)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
por: Kim, Bosung, et al.
Publicado: (2025)
por: Kim, Bosung, et al.
Publicado: (2025)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
por: Zhang, Tianfang, et al.
Publicado: (2024)
por: Zhang, Tianfang, et al.
Publicado: (2024)
Mobile-GS: Real-time Gaussian Splatting for Mobile Devices
por: Du, Xiaobiao, et al.
Publicado: (2026)
por: Du, Xiaobiao, et al.
Publicado: (2026)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
por: Shaker, Abdelrahman, et al.
Publicado: (2025)
por: Shaker, Abdelrahman, et al.
Publicado: (2025)
A Large-Scale Study on Video Action Dataset Condensation
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Turbo-VAED: Fast and Stable Transfer of Video-VAEs to Mobile Devices
por: Zou, Ya, et al.
Publicado: (2025)
por: Zou, Ya, et al.
Publicado: (2025)
MonoMobility: Zero-Shot 3D Mobility Analysis from Monocular Videos
por: Zhou, Hongyi, et al.
Publicado: (2025)
por: Zhou, Hongyi, et al.
Publicado: (2025)
VTD-CLIP: Video-to-Text Discretization via Prompting CLIP
por: Zhu, Wencheng, et al.
Publicado: (2025)
por: Zhu, Wencheng, et al.
Publicado: (2025)
Efficient Few-Shot Learning for Edge AI via Knowledge Distillation on MobileViT
por: Tsuyuki, Shuhei, et al.
Publicado: (2026)
por: Tsuyuki, Shuhei, et al.
Publicado: (2026)
Adapting Short-Term Transformers for Action Detection in Untrimmed Videos
por: Yang, Min, et al.
Publicado: (2023)
por: Yang, Min, et al.
Publicado: (2023)
Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device
por: Shaker, Abdelrahman, et al.
Publicado: (2026)
por: Shaker, Abdelrahman, et al.
Publicado: (2026)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2023)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2023)
PDPP: Projected Diffusion for Procedure Planning in Instructional Videos
por: Wang, Hanlin, et al.
Publicado: (2023)
por: Wang, Hanlin, et al.
Publicado: (2023)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
por: Chu, Xiangxiang, et al.
Publicado: (2023)
por: Chu, Xiangxiang, et al.
Publicado: (2023)
Efficient Neural Light Fields (ENeLF) for Mobile Devices
por: Peng, Austin
Publicado: (2024)
por: Peng, Austin
Publicado: (2024)
Real-Time Vehicle Detection and Urban Traffic Behavior Analysis Based on UAV Traffic Videos on Mobile Devices
por: Zhu, Yuan, et al.
Publicado: (2024)
por: Zhu, Yuan, et al.
Publicado: (2024)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
por: Chen, Harold Haodong, et al.
Publicado: (2025)
por: Chen, Harold Haodong, et al.
Publicado: (2025)
ViLA: Efficient Video-Language Alignment for Video Question Answering
por: Wang, Xijun, et al.
Publicado: (2023)
por: Wang, Xijun, et al.
Publicado: (2023)
Dynamic DNNs and Runtime Management for Efficient Inference on Mobile/Embedded Devices
por: Xun, Lei, et al.
Publicado: (2024)
por: Xun, Lei, et al.
Publicado: (2024)
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
por: Yang, Min, et al.
Publicado: (2024)
por: Yang, Min, et al.
Publicado: (2024)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
por: Yuan, Zhengqing, et al.
Publicado: (2024)
por: Yuan, Zhengqing, et al.
Publicado: (2024)
VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling
por: Zhang, Qian, et al.
Publicado: (2024)
por: Zhang, Qian, et al.
Publicado: (2024)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
por: Wang, Chenting, et al.
Publicado: (2025)
por: Wang, Chenting, et al.
Publicado: (2025)
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
por: Wang, Junyang, et al.
Publicado: (2024)
por: Wang, Junyang, et al.
Publicado: (2024)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
por: Wang, Junyang, et al.
Publicado: (2024)
por: Wang, Junyang, et al.
Publicado: (2024)
MoCLIP-Lite: Efficient Video Recognition by Fusing CLIP with Motion Vectors
por: Huang, Binhua, et al.
Publicado: (2025)
por: Huang, Binhua, et al.
Publicado: (2025)
ViTMAlis: Towards Latency-Critical Mobile Video Analytics with Vision Transformers
por: Zhang, Miao, et al.
Publicado: (2026)
por: Zhang, Miao, et al.
Publicado: (2026)
ViViD: Video Virtual Try-on using Diffusion Models
por: Fang, Zixun, et al.
Publicado: (2024)
por: Fang, Zixun, et al.
Publicado: (2024)
Porting Large Language Models to Mobile Devices for Question Answering
por: Fassold, Hannes
Publicado: (2024)
por: Fassold, Hannes
Publicado: (2024)
MobilePlantViT: A Mobile-friendly Hybrid ViT for Generalized Plant Disease Image Classification
por: Tonmoy, Moshiur Rahman, et al.
Publicado: (2025)
por: Tonmoy, Moshiur Rahman, et al.
Publicado: (2025)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
por: Wang, Junyang, et al.
Publicado: (2025)
por: Wang, Junyang, et al.
Publicado: (2025)
Imp: Highly Capable Large Multimodal Models for Mobile Devices
por: Shao, Zhenwei, et al.
Publicado: (2024)
por: Shao, Zhenwei, et al.
Publicado: (2024)
Ejemplares similares
-
MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices
por: Zhao, Yang, et al.
Publicado: (2023) -
MoViE: Mobile Diffusion for Video Editing
por: Karjauv, Adil, et al.
Publicado: (2024) -
RepViT: Revisiting Mobile CNN From ViT Perspective
por: Wang, Ao, et al.
Publicado: (2023) -
MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices
por: Zhang, Shuai, et al.
Publicado: (2025) -
Towards Real-time Video Compressive Sensing on Mobile Devices
por: Cao, Miao, et al.
Publicado: (2024)