Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhao, Liu, Chang, Zhang, Shaoting, Dou, Qi |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large-scale Self-supervised Video Foundation Model for Intelligent Surgery
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
NimbleD: Enhancing Self-supervised Monocular Depth Estimation with Pseudo-labels and Large-scale Video Pre-training
par: Luginov, Albert, et autres
Publié: (2024)
par: Luginov, Albert, et autres
Publié: (2024)
Structure-aware World Model for Probe Guidance via Large-scale Self-supervised Pre-train
par: Jiang, Haojun, et autres
Publié: (2024)
par: Jiang, Haojun, et autres
Publié: (2024)
Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy
par: Roth, Marcel, et autres
Publié: (2024)
par: Roth, Marcel, et autres
Publié: (2024)
SPAST: Arbitrary Style Transfer with Style Priors via Pre-trained Large-scale Model
par: Zhang, Zhanjie, et autres
Publié: (2025)
par: Zhang, Zhanjie, et autres
Publié: (2025)
OpenPath: Open-Set Active Learning for Pathology Image Classification via Pre-trained Vision-Language Models
par: Zhong, Lanfeng, et autres
Publié: (2025)
par: Zhong, Lanfeng, et autres
Publié: (2025)
Efficient Transferability Assessment for Selection of Pre-trained Detectors
par: Wang, Zhao, et autres
Publié: (2024)
par: Wang, Zhao, et autres
Publié: (2024)
Training-free Video Temporal Grounding using Large-scale Pre-trained Models
par: Zheng, Minghang, et autres
Publié: (2024)
par: Zheng, Minghang, et autres
Publié: (2024)
EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training
par: Tian, Qingyao, et autres
Publié: (2025)
par: Tian, Qingyao, et autres
Publié: (2025)
Large-scale Pre-training for Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2025)
par: Kazakos, Evangelos, et autres
Publié: (2025)
E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training
par: Zhao, Qitao, et autres
Publié: (2025)
par: Zhao, Qitao, et autres
Publié: (2025)
Advancing Video Self-Supervised Learning via Image Foundation Models
par: Wu, Jingwei, et autres
Publié: (2025)
par: Wu, Jingwei, et autres
Publié: (2025)
Parameter-efficient Tuning of Large-scale Multimodal Foundation Model
par: Wang, Haixin, et autres
Publié: (2023)
par: Wang, Haixin, et autres
Publié: (2023)
EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning
par: Yao, Jingfeng, et autres
Publié: (2024)
par: Yao, Jingfeng, et autres
Publié: (2024)
Multi-modal Vision Pre-training for Medical Image Analysis
par: Rui, Shaohao, et autres
Publié: (2024)
par: Rui, Shaohao, et autres
Publié: (2024)
Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation
par: Lin, Sihao, et autres
Publié: (2025)
par: Lin, Sihao, et autres
Publié: (2025)
Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models
par: Orlova, Svetlana, et autres
Publié: (2026)
par: Orlova, Svetlana, et autres
Publié: (2026)
MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
Revealing Latent Information: A Physics-inspired Self-supervised Pre-training Framework for Noisy and Sparse Events
par: Zhu, Lin, et autres
Publié: (2025)
par: Zhu, Lin, et autres
Publié: (2025)
MedCAL-Bench: A Comprehensive Benchmark on Cold-Start Active Learning with Foundation Models for Medical Image Analysis
par: Zhu, Ning, et autres
Publié: (2025)
par: Zhu, Ning, et autres
Publié: (2025)
Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding
par: Shui, Zhongyi, et autres
Publié: (2025)
par: Shui, Zhongyi, et autres
Publié: (2025)
Endora: Video Generation Models as Endoscopy Simulators
par: Li, Chenxin, et autres
Publié: (2024)
par: Li, Chenxin, et autres
Publié: (2024)
Learning to Adapt Foundation Model DINOv2 for Capsule Endoscopy Diagnosis
par: Zhang, Bowen, et autres
Publié: (2024)
par: Zhang, Bowen, et autres
Publié: (2024)
Temporal-Consistent Video Restoration with Pre-trained Diffusion Models
par: Wang, Hengkang, et autres
Publié: (2025)
par: Wang, Hengkang, et autres
Publié: (2025)
SMFormer: Empowering Self-supervised Stereo Matching via Foundation Models and Data Augmentation
par: Wang, Yun, et autres
Publié: (2026)
par: Wang, Yun, et autres
Publié: (2026)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
par: Hu, Bin, et autres
Publié: (2024)
par: Hu, Bin, et autres
Publié: (2024)
Self-supervised Pre-training of Text Recognizers
par: Kišš, Martin, et autres
Publié: (2024)
par: Kišš, Martin, et autres
Publié: (2024)
Temporal Overlapping Prediction: A Self-supervised Pre-training Method for LiDAR Moving Object Segmentation
par: Miao, Ziliang, et autres
Publié: (2025)
par: Miao, Ziliang, et autres
Publié: (2025)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
par: Chen, Lan, et autres
Publié: (2025)
par: Chen, Lan, et autres
Publié: (2025)
RET-CLIP: A Retinal Image Foundation Model Pre-trained with Clinical Diagnostic Reports
par: Du, Jiawei, et autres
Publié: (2024)
par: Du, Jiawei, et autres
Publié: (2024)
InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-training
par: Luo, Zihao, et autres
Publié: (2025)
par: Luo, Zihao, et autres
Publié: (2025)
A Multimodal Pre-trained Network for Integrated EEG-Video Seizure Detection
par: Lu, Tong, et autres
Publié: (2026)
par: Lu, Tong, et autres
Publié: (2026)
Fairness Analysis of CLIP-Based Foundation Models for X-Ray Image Classification
par: Sun, Xiangyu, et autres
Publié: (2025)
par: Sun, Xiangyu, et autres
Publié: (2025)
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
par: Yu, Yongrui, et autres
Publié: (2024)
par: Yu, Yongrui, et autres
Publié: (2024)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Pre-training Everywhere: Parameter-Efficient Fine-Tuning for Medical Image Analysis via Target Parameter Pre-training
par: Lei, Xingliang, et autres
Publié: (2024)
par: Lei, Xingliang, et autres
Publié: (2024)
Training-Free Semantic Video Composition via Pre-trained Diffusion Model
par: Guo, Jiaqi, et autres
Publié: (2024)
par: Guo, Jiaqi, et autres
Publié: (2024)
Canny2Palm: Realistic and Controllable Palmprint Generation for Large-scale Pre-training
par: Lan, Xingzeng, et autres
Publié: (2025)
par: Lan, Xingzeng, et autres
Publié: (2025)
Contrastive Language Video Time Pre-training
par: Liu, Hengyue, et autres
Publié: (2024)
par: Liu, Hengyue, et autres
Publié: (2024)
Documents similaires
-
Large-scale Self-supervised Video Foundation Model for Intelligent Surgery
par: Yang, Shu, et autres
Publié: (2025) -
NimbleD: Enhancing Self-supervised Monocular Depth Estimation with Pseudo-labels and Large-scale Video Pre-training
par: Luginov, Albert, et autres
Publié: (2024) -
Structure-aware World Model for Probe Guidance via Large-scale Self-supervised Pre-train
par: Jiang, Haojun, et autres
Publié: (2024) -
Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy
par: Roth, Marcel, et autres
Publié: (2024) -
SPAST: Arbitrary Style Transfer with Style Priors via Pre-trained Large-scale Model
par: Zhang, Zhanjie, et autres
Publié: (2025)