VESSA: Video-based objEct-centric Self-Supervised Adaptation for Visual Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Barreto, Jesimon, Caetano, Carlos, Araujo, André, Schwartz, William Robson |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
por: Qian, Rui, et al.
Publicado: (2024)
por: Qian, Rui, et al.
Publicado: (2024)
Advancing Video Self-Supervised Learning via Image Foundation Models
por: Wu, Jingwei, et al.
Publicado: (2025)
por: Wu, Jingwei, et al.
Publicado: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models
por: Rafaeli, Osher, et al.
Publicado: (2026)
por: Rafaeli, Osher, et al.
Publicado: (2026)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
por: Xu, Jilan, et al.
Publicado: (2025)
por: Xu, Jilan, et al.
Publicado: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
por: Pei, Baoqi, et al.
Publicado: (2024)
por: Pei, Baoqi, et al.
Publicado: (2024)
Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in Videos
por: Qian, Rui, et al.
Publicado: (2023)
por: Qian, Rui, et al.
Publicado: (2023)
Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video
por: Gao, Zihui, et al.
Publicado: (2026)
por: Gao, Zihui, et al.
Publicado: (2026)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
por: Wang, Chenting, et al.
Publicado: (2025)
por: Wang, Chenting, et al.
Publicado: (2025)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
por: Pei, Gensheng, et al.
Publicado: (2024)
por: Pei, Gensheng, et al.
Publicado: (2024)
Weakly Supervised Concept Learning for Object-centric Visual Reasoning
por: Tiwari, Sparsh, et al.
Publicado: (2026)
por: Tiwari, Sparsh, et al.
Publicado: (2026)
Self-Consistent Model-based Adaptation for Visual Reinforcement Learning
por: Zhou, Xinning, et al.
Publicado: (2025)
por: Zhou, Xinning, et al.
Publicado: (2025)
AdaCropFollow: Self-Supervised Online Adaptation for Visual Under-Canopy Navigation
por: Sivakumar, Arun N., et al.
Publicado: (2024)
por: Sivakumar, Arun N., et al.
Publicado: (2024)
Improving the Generalization of Segmentation Foundation Model under Distribution Shift via Weakly Supervised Adaptation
por: Zhang, Haojie, et al.
Publicado: (2023)
por: Zhang, Haojie, et al.
Publicado: (2023)
Towards More General Video-based Deepfake Detection through Facial Component Guided Adaptation for Foundation Model
por: Han, Yue-Hua, et al.
Publicado: (2024)
por: Han, Yue-Hua, et al.
Publicado: (2024)
VideoSAVi: Self-Aligned Video Language Models without Human Supervision
por: Kulkarni, Yogesh, et al.
Publicado: (2024)
por: Kulkarni, Yogesh, et al.
Publicado: (2024)
Efficient Self-Supervised Adaptation for Medical Image Analysis
por: Sorkhei, Moein, et al.
Publicado: (2025)
por: Sorkhei, Moein, et al.
Publicado: (2025)
VideoSSR: Video Self-Supervised Reinforcement Learning
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
How Effective are Self-Supervised Models for Contact Identification in Videos
por: Gunawardhana, Malitha, et al.
Publicado: (2024)
por: Gunawardhana, Malitha, et al.
Publicado: (2024)
Decorrelation-based Self-Supervised Visual Representation Learning for Writer Identification
por: Maitra, Arkadip, et al.
Publicado: (2024)
por: Maitra, Arkadip, et al.
Publicado: (2024)
SelfHVD: Self-Supervised Handheld Video Deblurring
por: Xu, Honglei, et al.
Publicado: (2025)
por: Xu, Honglei, et al.
Publicado: (2025)
Deep Weakly-Supervised Domain Adaptation for Pain Localization in Videos
por: Praveen, R. Gnana, et al.
Publicado: (2019)
por: Praveen, R. Gnana, et al.
Publicado: (2019)
Robust Adaptation of Foundation Models with Black-Box Visual Prompting
por: Oh, Changdae, et al.
Publicado: (2024)
por: Oh, Changdae, et al.
Publicado: (2024)
Supervised Fine-tuning in turn Improves Visual Foundation Models
por: Jiang, Xiaohu, et al.
Publicado: (2024)
por: Jiang, Xiaohu, et al.
Publicado: (2024)
Closer to Reality: Practical Semi-Supervised Federated Learning for Foundation Model Adaptation
por: Sun, Guangyu, et al.
Publicado: (2025)
por: Sun, Guangyu, et al.
Publicado: (2025)
EVDI++: Event-based Video Deblurring and Interpolation via Self-Supervised Learning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Self-Supervised Contrastive Embedding Adaptation for Endoscopic Image Matching
por: Rota, Alberto, et al.
Publicado: (2025)
por: Rota, Alberto, et al.
Publicado: (2025)
Reshoot-Anything: A Self-Supervised Model for In-the-Wild Video Reshooting
por: Paliwal, Avinash, et al.
Publicado: (2026)
por: Paliwal, Avinash, et al.
Publicado: (2026)
When Test-Time Adaptation Meets Self-Supervised Models
por: Han, Jisu, et al.
Publicado: (2025)
por: Han, Jisu, et al.
Publicado: (2025)
Self-Supervised Video Desmoking for Laparoscopic Surgery
por: Wu, Renlong, et al.
Publicado: (2024)
por: Wu, Renlong, et al.
Publicado: (2024)
Self-Supervised Animal Identification for Long Videos
por: Fang, Xuyang, et al.
Publicado: (2026)
por: Fang, Xuyang, et al.
Publicado: (2026)
InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation
por: Rao, Zhefan, et al.
Publicado: (2026)
por: Rao, Zhefan, et al.
Publicado: (2026)
Large-scale Self-supervised Video Foundation Model for Intelligent Surgery
por: Yang, Shu, et al.
Publicado: (2025)
por: Yang, Shu, et al.
Publicado: (2025)
SelfPrompt: Confidence-Aware Semi-Supervised Tuning for Robust Vision-Language Model Adaptation
por: Roy, Shuvendu, et al.
Publicado: (2025)
por: Roy, Shuvendu, et al.
Publicado: (2025)
VideoClusterNet: Self-Supervised and Adaptive Face Clustering For Videos
por: Walawalkar, Devesh, et al.
Publicado: (2024)
por: Walawalkar, Devesh, et al.
Publicado: (2024)
Enhancing License Plate Super-Resolution: A Layout-Aware and Character-Driven Approach
por: Nascimento, Valfride, et al.
Publicado: (2024)
por: Nascimento, Valfride, et al.
Publicado: (2024)
Enhancing Generalization of Depth Estimation Foundation Model via Weakly-Supervised Adaptation with Regularization
por: Huang, Yan, et al.
Publicado: (2025)
por: Huang, Yan, et al.
Publicado: (2025)
ORV: 4D Occupancy-centric Robot Video Generation
por: Yang, Xiuyu, et al.
Publicado: (2025)
por: Yang, Xiuyu, et al.
Publicado: (2025)
StainNet: Scaling Self-Supervised Foundation Models on Immunohistochemistry and Special Stains for Computational Pathology
por: Li, Jiawen, et al.
Publicado: (2025)
por: Li, Jiawen, et al.
Publicado: (2025)
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
por: Shekhar, Shivanshu, et al.
Publicado: (2026)
por: Shekhar, Shivanshu, et al.
Publicado: (2026)
Ejemplares similares
-
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
por: Qian, Rui, et al.
Publicado: (2024) -
Advancing Video Self-Supervised Learning via Image Foundation Models
por: Wu, Jingwei, et al.
Publicado: (2025) -
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025) -
Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models
por: Rafaeli, Osher, et al.
Publicado: (2026) -
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
por: Xu, Jilan, et al.
Publicado: (2025)