Deep video representation learning: a survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ravanbakhsh, Elham, Liang, Yongqing, Ramanujam, J., Li, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Weakly Supervised Semantic Segmentation with Multi-modal Foundation Models: An End-to-End Approach
par: Ravanbakhsh, Elham, et autres
Publié: (2024)
par: Ravanbakhsh, Elham, et autres
Publié: (2024)
CLAP: Concave Linear APproximation for Quadratic Graph Matching
par: Liang, Yongqing, et autres
Publié: (2024)
par: Liang, Yongqing, et autres
Publié: (2024)
Towards multi-modal forgery representation learning for AI-generated video detection and localization
par: Le, Dat, et autres
Publié: (2026)
par: Le, Dat, et autres
Publié: (2026)
Deep learning for action spotting in association football videos
par: Giancola, Silvio, et autres
Publié: (2024)
par: Giancola, Silvio, et autres
Publié: (2024)
Skull-to-Face: Anatomy-Guided 3D Facial Reconstruction and Editing
par: Liang, Yongqing, et autres
Publié: (2024)
par: Liang, Yongqing, et autres
Publié: (2024)
Contrastive learning-based video quality assessment-jointed video vision transformer for video recognition
par: Sun, Jian, et autres
Publié: (2026)
par: Sun, Jian, et autres
Publié: (2026)
Deep transfer learning for image classification: a survey
par: Plested, Jo, et autres
Publié: (2022)
par: Plested, Jo, et autres
Publié: (2022)
DeepSet SimCLR: Self-supervised deep sets for improved pathology representation learning
par: Torpey, David, et autres
Publié: (2024)
par: Torpey, David, et autres
Publié: (2024)
A Survey on Computational Solutions for Reconstructing Complete Objects by Reassembling Their Fractured Parts
par: Lu, Jiaxin, et autres
Publié: (2024)
par: Lu, Jiaxin, et autres
Publié: (2024)
Self-supervised learning of video representations from a child's perspective
par: Orhan, A. Emin, et autres
Publié: (2024)
par: Orhan, A. Emin, et autres
Publié: (2024)
ADHD diagnosis based on action characteristics recorded in videos using machine learning
par: Li, Yichun, et autres
Publié: (2024)
par: Li, Yichun, et autres
Publié: (2024)
Self-supervised structured object representation learning
par: Hadjerci, Oussama, et autres
Publié: (2025)
par: Hadjerci, Oussama, et autres
Publié: (2025)
Deep kernel video approximation for unsupervised action segmentation
par: Pintea, Silvia L., et autres
Publié: (2026)
par: Pintea, Silvia L., et autres
Publié: (2026)
Shadow loss: Memory-linear deep metric learning for efficient training
par: Khan, Alif Elham, et autres
Publié: (2023)
par: Khan, Alif Elham, et autres
Publié: (2023)
Disentangled Clothed Avatar Generation from Text Descriptions
par: Wang, Jionghao, et autres
Publié: (2023)
par: Wang, Jionghao, et autres
Publié: (2023)
Multi-model learning by sequential reading of untrimmed videos for action recognition
par: Kamiya, Kodai, et autres
Publié: (2024)
par: Kamiya, Kodai, et autres
Publié: (2024)
Self-supervised contrastive learning of echocardiogram videos enables label-efficient cardiac disease diagnosis
par: Holste, Gregory, et autres
Publié: (2022)
par: Holste, Gregory, et autres
Publié: (2022)
Deep learning for 3D human pose estimation and mesh recovery: A survey
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
Legilimens: Performant Video Analytics on the System-on-Chip Edge
par: Ramanujam, Murali, et autres
Publié: (2025)
par: Ramanujam, Murali, et autres
Publié: (2025)
OmViD: Omni-supervised active learning for video action detection
par: Rana, Aayush, et autres
Publié: (2025)
par: Rana, Aayush, et autres
Publié: (2025)
Deep learning-based neurodevelopmental assessment in preterm infants
par: Ren, Lexin, et autres
Publié: (2026)
par: Ren, Lexin, et autres
Publié: (2026)
A multi-center analysis of deep learning methods for video polyp detection and segmentation
par: Ghatwary, Noha, et autres
Publié: (2026)
par: Ghatwary, Noha, et autres
Publié: (2026)
A comprehensive survey on deep active learning in medical image analysis
par: Wang, Haoran, et autres
Publié: (2023)
par: Wang, Haoran, et autres
Publié: (2023)
Do text-free diffusion models learn discriminative visual representations?
par: Mukhopadhyay, Soumik, et autres
Publié: (2023)
par: Mukhopadhyay, Soumik, et autres
Publié: (2023)
Modeling Visual Memorability Assessment with Autoencoders Reveals Characteristics of Memorable Images
par: Bagheri, Elham, et autres
Publié: (2024)
par: Bagheri, Elham, et autres
Publié: (2024)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
par: Tang, Haoran, et autres
Publié: (2024)
par: Tang, Haoran, et autres
Publié: (2024)
SolidGS: Consolidating Gaussian Surfel Splatting for Sparse-View Surface Reconstruction
par: Shen, Zhuowen, et autres
Publié: (2024)
par: Shen, Zhuowen, et autres
Publié: (2024)
Oriented object detection in optical remote sensing images using deep learning: a survey
par: Wang, Kun, et autres
Publié: (2023)
par: Wang, Kun, et autres
Publié: (2023)
Towards classification-based representation learning for place recognition on LiDAR scans
par: Konoplia, Maksim, et autres
Publié: (2025)
par: Konoplia, Maksim, et autres
Publié: (2025)
An extremely coarse feedback signal is sufficient for learning human-aligned visual representations
par: Mehta, Yash, et autres
Publié: (2026)
par: Mehta, Yash, et autres
Publié: (2026)
Learning dissection trajectories from expert surgical videos via imitation learning with equivariant diffusion
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
PS-GS: Gaussian Splatting for Multi-View Photometric Stereo
par: Chen, Yixiao, et autres
Publié: (2025)
par: Chen, Yixiao, et autres
Publié: (2025)
RadEyeVideo: Enhancing general-domain Large Vision Language Model for chest X-ray analysis with video representations of eye gaze
par: Kim, Yunsoo, et autres
Publié: (2025)
par: Kim, Yunsoo, et autres
Publié: (2025)
Deep learning in motion deblurring: current status, benchmarks and future prospects
par: Xiang, Yawen, et autres
Publié: (2024)
par: Xiang, Yawen, et autres
Publié: (2024)
MV-MR: multi-views and multi-representations for self-supervised learning and knowledge distillation
par: Kinakh, Vitaliy, et autres
Publié: (2023)
par: Kinakh, Vitaliy, et autres
Publié: (2023)
Restereo: Diffusion stereo video generation and restoration
par: Huang, Xingchang, et autres
Publié: (2025)
par: Huang, Xingchang, et autres
Publié: (2025)
DeepSea MOT: A benchmark dataset for multi-object tracking on deep-sea video
par: Barnard, Kevin, et autres
Publié: (2025)
par: Barnard, Kevin, et autres
Publié: (2025)
DLM-VMTL:A Double Layer Mapper for heterogeneous data video Multi-task prompt learning
par: Bo, Zeyi, et autres
Publié: (2024)
par: Bo, Zeyi, et autres
Publié: (2024)
Generative deep learning for foundational video translation in ultrasound
par: Tomic, Nikolina, et autres
Publié: (2025)
par: Tomic, Nikolina, et autres
Publié: (2025)
Documents similaires
-
Enhancing Weakly Supervised Semantic Segmentation with Multi-modal Foundation Models: An End-to-End Approach
par: Ravanbakhsh, Elham, et autres
Publié: (2024) -
CLAP: Concave Linear APproximation for Quadratic Graph Matching
par: Liang, Yongqing, et autres
Publié: (2024) -
Towards multi-modal forgery representation learning for AI-generated video detection and localization
par: Le, Dat, et autres
Publié: (2026) -
Deep learning for action spotting in association football videos
par: Giancola, Silvio, et autres
Publié: (2024) -
Skull-to-Face: Anatomy-Guided 3D Facial Reconstruction and Editing
par: Liang, Yongqing, et autres
Publié: (2024)