Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jinxuan, Tan, Chaolei, Chen, Haoxuan, Ma, Jianxin, Hu, Jian-Fang, Lai, Jianhuang, Zheng, Wei-Shi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
by: Tan, Chaolei, et al.
Published: (2024)
by: Tan, Chaolei, et al.
Published: (2024)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
by: Liang, Tianming, et al.
Published: (2025)
by: Liang, Tianming, et al.
Published: (2025)
TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding
by: Li, Jinxuan, et al.
Published: (2025)
by: Li, Jinxuan, et al.
Published: (2025)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
by: Liang, Tianming, et al.
Published: (2025)
by: Liang, Tianming, et al.
Published: (2025)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
by: Liang, Tianming, et al.
Published: (2024)
by: Liang, Tianming, et al.
Published: (2024)
HarmoGS: Robust 3D Gaussian Splatting in the Wild via Conflict-Aware Gradient Harmonization
by: Kang, Yulei, et al.
Published: (2026)
by: Kang, Yulei, et al.
Published: (2026)
Progressive Pretext Task Learning for Human Trajectory Prediction
by: Lin, Xiaotong, et al.
Published: (2024)
by: Lin, Xiaotong, et al.
Published: (2024)
SAUGE: Taming SAM for Uncertainty-Aligned Multi-Granularity Edge Detection
by: Liufu, Xing, et al.
Published: (2024)
by: Liufu, Xing, et al.
Published: (2024)
Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval
by: Liu, Mingyu, et al.
Published: (2026)
by: Liu, Mingyu, et al.
Published: (2026)
Null-LoRA: Low-Rank Adaptation on Null Space
by: Zhang, Yi, et al.
Published: (2025)
by: Zhang, Yi, et al.
Published: (2025)
Survey on Adversarial Attack and Defense for Medical Image Analysis: Methods and Challenges
by: Dong, Junhao, et al.
Published: (2023)
by: Dong, Junhao, et al.
Published: (2023)
Low-Light Image and Video Enhancement: A Comprehensive Survey and Beyond
by: Zheng, Shen, et al.
Published: (2022)
by: Zheng, Shen, et al.
Published: (2022)
CoopDiff: Anticipating 3D Human-object Interactions via Contact-consistent Decoupled Diffusion
by: Lin, Xiaotong, et al.
Published: (2025)
by: Lin, Xiaotong, et al.
Published: (2025)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
by: Tan, Chaolei, et al.
Published: (2024)
by: Tan, Chaolei, et al.
Published: (2024)
Human Image Generation: A Comprehensive Survey
by: Jia, Zhen, et al.
Published: (2022)
by: Jia, Zhen, et al.
Published: (2022)
Selective Hourglass Mapping for Universal Image Restoration Based on Diffusion Model
by: Zheng, Dian, et al.
Published: (2024)
by: Zheng, Dian, et al.
Published: (2024)
A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models
by: Sahoo, Pranab, et al.
Published: (2024)
by: Sahoo, Pranab, et al.
Published: (2024)
Deep Learning-based Image and Video Inpainting: A Survey
by: Quan, Weize, et al.
Published: (2024)
by: Quan, Weize, et al.
Published: (2024)
Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution
by: Wang, Hongsong, et al.
Published: (2026)
by: Wang, Hongsong, et al.
Published: (2026)
Distill Video Datasets into Images
by: Zhao, Zhenghao, et al.
Published: (2025)
by: Zhao, Zhenghao, et al.
Published: (2025)
Distilled-3DGS:Distilled 3D Gaussian Splatting
by: Xiang, Lintao, et al.
Published: (2025)
by: Xiang, Lintao, et al.
Published: (2025)
Hard-normal Example-aware Template Mutual Matching for Industrial Anomaly Detection
by: Chen, Zixuan, et al.
Published: (2023)
by: Chen, Zixuan, et al.
Published: (2023)
Releasing Inequality Phenomenon in $\ell_{\infty}$-norm Adversarial Training via Input Gradient Distillation
by: Chen, Junxi, et al.
Published: (2023)
by: Chen, Junxi, et al.
Published: (2023)
Exploring Foundation Models in Remote Sensing Image Change Detection: A Comprehensive Survey
by: Yu, Zihan, et al.
Published: (2024)
by: Yu, Zihan, et al.
Published: (2024)
Single Trajectory Distillation for Accelerating Image and Video Style Transfer
by: Xu, Sijie, et al.
Published: (2024)
by: Xu, Sijie, et al.
Published: (2024)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
by: Wei, Hao, et al.
Published: (2024)
by: Wei, Hao, et al.
Published: (2024)
SAM2 for Image and Video Segmentation: A Comprehensive Survey
by: Jiaxing, Zhang, et al.
Published: (2025)
by: Jiaxing, Zhang, et al.
Published: (2025)
Paired Image Generation with Diffusion-Guided Diffusion Models
by: Zhang, Haoxuan, et al.
Published: (2025)
by: Zhang, Haoxuan, et al.
Published: (2025)
Panorama Generation From NFoV Image Done Right
by: Zheng, Dian, et al.
Published: (2025)
by: Zheng, Dian, et al.
Published: (2025)
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
by: Liu, Ye, et al.
Published: (2024)
by: Liu, Ye, et al.
Published: (2024)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
by: Jiang, Haichao, et al.
Published: (2026)
by: Jiang, Haichao, et al.
Published: (2026)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
by: Dang, Jisheng, et al.
Published: (2025)
by: Dang, Jisheng, et al.
Published: (2025)
Self-Supervised Learning for Image Segmentation: A Comprehensive Survey
by: Akilan, Thangarajah, et al.
Published: (2025)
by: Akilan, Thangarajah, et al.
Published: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
LOTA: Bit-Planes Guided AI-Generated Image Detection
by: Wang, Hongsong, et al.
Published: (2025)
by: Wang, Hongsong, et al.
Published: (2025)
Foundation Models for Biomedical Image Segmentation: A Survey
by: Lee, Ho Hin, et al.
Published: (2024)
by: Lee, Ho Hin, et al.
Published: (2024)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
by: Fu, Shenghao, et al.
Published: (2024)
by: Fu, Shenghao, et al.
Published: (2024)
A Comprehensive Survey on Underwater Image Enhancement Based on Deep Learning
by: Cong, Xiaofeng, et al.
Published: (2024)
by: Cong, Xiaofeng, et al.
Published: (2024)
Advancing Video Self-Supervised Learning via Image Foundation Models
by: Wu, Jingwei, et al.
Published: (2025)
by: Wu, Jingwei, et al.
Published: (2025)
MedCAL-Bench: A Comprehensive Benchmark on Cold-Start Active Learning with Foundation Models for Medical Image Analysis
by: Zhu, Ning, et al.
Published: (2025)
by: Zhu, Ning, et al.
Published: (2025)
Similar Items
-
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
by: Tan, Chaolei, et al.
Published: (2024) -
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
by: Liang, Tianming, et al.
Published: (2025) -
TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding
by: Li, Jinxuan, et al.
Published: (2025) -
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
by: Liang, Tianming, et al.
Published: (2025) -
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
by: Liang, Tianming, et al.
Published: (2024)