Efficient Transfer Learning for Video-language Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Haoxing, Huang, Zizheng, Hong, Yan, Wang, Yanshuo, Lyu, Zhongcai, Xu, Zhuoer, Lan, Jun, Gu, Zhangxuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Boosting Audio-visual Zero-shot Learning with Large Language Models
di: Chen, Haoxing, et al.
Pubblicazione: (2023)
di: Chen, Haoxing, et al.
Pubblicazione: (2023)
Conditional Prototype Rectification Prompt Learning
di: Chen, Haoxing, et al.
Pubblicazione: (2024)
di: Chen, Haoxing, et al.
Pubblicazione: (2024)
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
di: Chen, Haoxing, et al.
Pubblicazione: (2024)
di: Chen, Haoxing, et al.
Pubblicazione: (2024)
Adaptive and Balanced Re-initialization for Long-timescale Continual Test-time Domain Adaptation
di: Wang, Yanshuo, et al.
Pubblicazione: (2026)
di: Wang, Yanshuo, et al.
Pubblicazione: (2026)
Maintain Plasticity in Long-timescale Continual Test-time Adaptation
di: Wang, Yanshuo, et al.
Pubblicazione: (2024)
di: Wang, Yanshuo, et al.
Pubblicazione: (2024)
Stochastic Layer-Wise Shuffle for Improving Vision Mamba Training
di: Huang, Zizheng, et al.
Pubblicazione: (2024)
di: Huang, Zizheng, et al.
Pubblicazione: (2024)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024)
di: Chen, Boyu, et al.
Pubblicazione: (2024)
Seeing Further on the Shoulders of Giants: Knowledge Inheritance for Vision Foundation Models
di: Huang, Jiabo, et al.
Pubblicazione: (2025)
di: Huang, Jiabo, et al.
Pubblicazione: (2025)
Long Video Understanding with Learnable Retrieval in Video-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
Robustness in AI-Generated Detection: Enhancing Resistance to Adversarial Attacks
di: Haoxuan, Sun, et al.
Pubblicazione: (2025)
di: Haoxuan, Sun, et al.
Pubblicazione: (2025)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
di: Chen, Lan, et al.
Pubblicazione: (2026)
di: Chen, Lan, et al.
Pubblicazione: (2026)
Few-shot Calligraphy Style Learning
di: Chen, Fangda, et al.
Pubblicazione: (2024)
di: Chen, Fangda, et al.
Pubblicazione: (2024)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
Style Transfer: From Stitching to Neural Networks
di: Xu, Xinhe, et al.
Pubblicazione: (2024)
di: Xu, Xinhe, et al.
Pubblicazione: (2024)
Slot-VLM: SlowFast Slots for Video-Language Modeling
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition
di: Yang, Shu, et al.
Pubblicazione: (2024)
di: Yang, Shu, et al.
Pubblicazione: (2024)
Advancing Video Self-Supervised Learning via Image Foundation Models
di: Wu, Jingwei, et al.
Pubblicazione: (2025)
di: Wu, Jingwei, et al.
Pubblicazione: (2025)
VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models
di: Zhang, Xiangdong, et al.
Pubblicazione: (2025)
di: Zhang, Xiangdong, et al.
Pubblicazione: (2025)
Implicit Modeling for Transferability Estimation of Vision Foundation Models
di: Zheng, Yaoyan, et al.
Pubblicazione: (2025)
di: Zheng, Yaoyan, et al.
Pubblicazione: (2025)
UniVBench: Towards Unified Evaluation for Video Foundation Models
di: Wei, Jianhui, et al.
Pubblicazione: (2026)
di: Wei, Jianhui, et al.
Pubblicazione: (2026)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
di: Cai, Yufei, et al.
Pubblicazione: (2025)
di: Cai, Yufei, et al.
Pubblicazione: (2025)
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
di: Wang, Zhen, et al.
Pubblicazione: (2026)
di: Wang, Zhen, et al.
Pubblicazione: (2026)
Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
di: Li, Jinxuan, et al.
Pubblicazione: (2025)
di: Li, Jinxuan, et al.
Pubblicazione: (2025)
Learnable Patchmatch and Self-Teaching for Multi-Frame Depth Estimation in Monocular Endoscopy
di: Shao, Shuwei, et al.
Pubblicazione: (2022)
di: Shao, Shuwei, et al.
Pubblicazione: (2022)
E-ANT: A Large-Scale Dataset for Efficient Automatic GUI NavigaTion
di: Wang, Ke, et al.
Pubblicazione: (2024)
di: Wang, Ke, et al.
Pubblicazione: (2024)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training
di: Tian, Qingyao, et al.
Pubblicazione: (2025)
di: Tian, Qingyao, et al.
Pubblicazione: (2025)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
Harvest Video Foundation Models via Efficient Post-Pretraining
di: Li, Yizhuo, et al.
Pubblicazione: (2023)
di: Li, Yizhuo, et al.
Pubblicazione: (2023)
Dual-Adapter: Training-free Dual Adaptation for Few-shot Out-of-Distribution Detection
di: Chen, Xinyi, et al.
Pubblicazione: (2024)
di: Chen, Xinyi, et al.
Pubblicazione: (2024)
MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
Towards More General Video-based Deepfake Detection through Facial Component Guided Adaptation for Foundation Model
di: Han, Yue-Hua, et al.
Pubblicazione: (2024)
di: Han, Yue-Hua, et al.
Pubblicazione: (2024)
SimMAT: Exploring Transferability from Vision Foundation Models to Any Image Modality
di: Lei, Chenyang, et al.
Pubblicazione: (2024)
di: Lei, Chenyang, et al.
Pubblicazione: (2024)
Fundus to Fluorescein Angiography Video Generation as a Retinal Generative Foundation Model
di: Zhang, Weiyi, et al.
Pubblicazione: (2024)
di: Zhang, Weiyi, et al.
Pubblicazione: (2024)
OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning
di: Hong, Lingyi, et al.
Pubblicazione: (2024)
di: Hong, Lingyi, et al.
Pubblicazione: (2024)
KASportsFormer: Kinematic Anatomy Enhanced Transformer for 3D Human Pose Estimation on Short Sports Scene Video
di: Yin, Zhuoer, et al.
Pubblicazione: (2025)
di: Yin, Zhuoer, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Boosting Audio-visual Zero-shot Learning with Large Language Models
di: Chen, Haoxing, et al.
Pubblicazione: (2023) -
Conditional Prototype Rectification Prompt Learning
di: Chen, Haoxing, et al.
Pubblicazione: (2024) -
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
di: Chen, Haoxing, et al.
Pubblicazione: (2024) -
Adaptive and Balanced Re-initialization for Long-timescale Continual Test-time Domain Adaptation
di: Wang, Yanshuo, et al.
Pubblicazione: (2026) -
Maintain Plasticity in Long-timescale Continual Test-time Adaptation
di: Wang, Yanshuo, et al.
Pubblicazione: (2024)