ReSW-VL: Representation Learning for Surgical Workflow Analysis Using Vision-Language Model
Fuente:
arXiv
Saved in:
| Main Author: | Kondo, Satoshi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ZEAL: Surgical Skill Assessment with Zero-shot Tool Inference Using Unified Foundation Model
by: Kondo, Satoshi
Published: (2024)
by: Kondo, Satoshi
Published: (2024)
Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review
by: Lin, Haoneng, et al.
Published: (2025)
by: Lin, Haoneng, et al.
Published: (2025)
Surgical Vision World Model
by: Koju, Saurabh, et al.
Published: (2025)
by: Koju, Saurabh, et al.
Published: (2025)
Spatio-Temporal Representation Decoupling and Enhancement for Federated Instrument Segmentation in Surgical Videos
by: Fang, Zheng, et al.
Published: (2025)
by: Fang, Zheng, et al.
Published: (2025)
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
by: Xin, Yu, et al.
Published: (2025)
by: Xin, Yu, et al.
Published: (2025)
Zero-Shot Surgical Tool Segmentation in Monocular Video Using Segment Anything Model 2
by: Lou, Ange, et al.
Published: (2024)
by: Lou, Ange, et al.
Published: (2024)
Operating Room Workflow Analysis via Reasoning Segmentation over Digital Twins
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Data-Efficient Learning for Generalizable Surgical Video Understanding
by: Nasirihaghighi, Sahar
Published: (2025)
by: Nasirihaghighi, Sahar
Published: (2025)
DiagR1: A Vision-Language Model Trained via Reinforcement Learning for Digestive Pathology Diagnosis
by: Ouyang, Minxi, et al.
Published: (2025)
by: Ouyang, Minxi, et al.
Published: (2025)
Vision Foundation Models in Medical Image Analysis: Advances and Challenges
by: Liang, Pengchen, et al.
Published: (2025)
by: Liang, Pengchen, et al.
Published: (2025)
Downstream Analysis of Foundational Medical Vision Models for Disease Progression
by: Demir, Basar, et al.
Published: (2025)
by: Demir, Basar, et al.
Published: (2025)
Dimensional Coactivation for Representational Consistency in Frozen Vision Foundation Models
by: Saddik, Izaldein Al-Zyoud Abdulmotaleb El
Published: (2026)
by: Saddik, Izaldein Al-Zyoud Abdulmotaleb El
Published: (2026)
From Attention to Frequency: Integration of Vision Transformer and FFT-ReLU for Enhanced Image Deblurring
by: Mahmud, Syed Mumtahin, et al.
Published: (2025)
by: Mahmud, Syed Mumtahin, et al.
Published: (2025)
Classification of Gleason Grading in Prostate Cancer Histopathology Images Using Deep Learning Techniques: YOLO, Vision Transformers, and Vision Mamba
by: Malekmohammadi, Amin, et al.
Published: (2024)
by: Malekmohammadi, Amin, et al.
Published: (2024)
Vision-Language Models vs Human: Perceptual Image Quality Assessment
by: Mehmood, Imran, et al.
Published: (2026)
by: Mehmood, Imran, et al.
Published: (2026)
Using Computer Vision for Skin Disease Diagnosis in Bangladesh Enhancing Interpretability and Transparency in Deep Learning Models for Skin Cancer Classification
by: Islam, Rafiul, et al.
Published: (2025)
by: Islam, Rafiul, et al.
Published: (2025)
Toward Zero-Shot Learning for Visual Dehazing of Urological Surgical Robots
by: Wu, Renkai, et al.
Published: (2024)
by: Wu, Renkai, et al.
Published: (2024)
High-Fidelity 3D Tooth Reconstruction by Fusing Intraoral Scans and CBCT Data via a Deep Implicit Representation
by: Zhu, Yi, et al.
Published: (2026)
by: Zhu, Yi, et al.
Published: (2026)
Comprehensive Analysis and Improvements in Pansharpening Using Deep Learning
by: Kantharia, Mahek, et al.
Published: (2024)
by: Kantharia, Mahek, et al.
Published: (2024)
Deep Learning-Based MR Image Re-parameterization
by: Narang, Abhijeet, et al.
Published: (2022)
by: Narang, Abhijeet, et al.
Published: (2022)
Vision-Language Model Based Multi-Expert Fusion for CT Image Classification
by: Bai, Jianfa, et al.
Published: (2026)
by: Bai, Jianfa, et al.
Published: (2026)
Robust Foreground-Background Separation for Severely-Degraded Videos Using Convolutional Sparse Representation Modeling
by: Naganuma, Kazuki, et al.
Published: (2025)
by: Naganuma, Kazuki, et al.
Published: (2025)
From Global Radiomics to Parametric Maps: A Unified Workflow Fusing Radiomics and Deep Learning for PDAC Detection
by: Deng, Zengtian, et al.
Published: (2026)
by: Deng, Zengtian, et al.
Published: (2026)
Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks
by: Müller-Franzes, Gustav, et al.
Published: (2025)
by: Müller-Franzes, Gustav, et al.
Published: (2025)
Optimising Graph Representation for Hardware Implementation of Graph Convolutional Networks for Event-based Vision
by: Jeziorek, Kamil, et al.
Published: (2024)
by: Jeziorek, Kamil, et al.
Published: (2024)
Rethinking Histology Slide Digitization Workflows for Low-Resource Settings
by: Zehra, Talat, et al.
Published: (2024)
by: Zehra, Talat, et al.
Published: (2024)
Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models
by: Jeong, Wongi, et al.
Published: (2026)
by: Jeong, Wongi, et al.
Published: (2026)
CLIP-RL: Surgical Scene Segmentation Using Contrastive Language-Vision Pretraining & Reinforcement Learning
by: Ahmed, Fatmaelzahraa Ali, et al.
Published: (2025)
by: Ahmed, Fatmaelzahraa Ali, et al.
Published: (2025)
Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images
by: Hu, Yutao, et al.
Published: (2025)
by: Hu, Yutao, et al.
Published: (2025)
VLSM-Ensemble: Ensembling CLIP-based Vision-Language Models for Enhanced Medical Image Segmentation
by: Dietlmeier, Julia, et al.
Published: (2025)
by: Dietlmeier, Julia, et al.
Published: (2025)
Mammo-CLIP: A Vision Language Foundation Model to Enhance Data Efficiency and Robustness in Mammography
by: Ghosh, Shantanu, et al.
Published: (2024)
by: Ghosh, Shantanu, et al.
Published: (2024)
Vision-Based Driver Drowsiness Monitoring: Comparative Analysis of YOLOv5-v11 Models
by: Herath, Dilshara, et al.
Published: (2025)
by: Herath, Dilshara, et al.
Published: (2025)
SASVi -- Segment Any Surgical Video
by: Sivakumar, Ssharvien Kumar, et al.
Published: (2025)
by: Sivakumar, Ssharvien Kumar, et al.
Published: (2025)
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
by: Wang, Guankun, et al.
Published: (2024)
by: Wang, Guankun, et al.
Published: (2024)
Comparative Analysis of Machine Learning Models for Lung Cancer Mutation Detection and Staging Using 3D CT Scans
by: Li, Yiheng, et al.
Published: (2025)
by: Li, Yiheng, et al.
Published: (2025)
HCDN: A Change Detection Network for Construction Housekeeping Using Feature Fusion and Large Vision Models
by: Sun, Kailai, et al.
Published: (2024)
by: Sun, Kailai, et al.
Published: (2024)
PRETI: Patient-Aware Retinal Foundation Model via Metadata-Guided Representation Learning
by: Lee, Yeonkyung, et al.
Published: (2025)
by: Lee, Yeonkyung, et al.
Published: (2025)
Similarity-aware Syncretic Latent Diffusion Model for Medical Image Translation with Representation Learning
by: Lin, Tingyi, et al.
Published: (2024)
by: Lin, Tingyi, et al.
Published: (2024)
Efficient Image Denoising Using Global and Local Circulant Representation
by: Kong, Zhaoming, et al.
Published: (2025)
by: Kong, Zhaoming, et al.
Published: (2025)
STING-BEE: Towards Vision-Language Model for Real-World X-ray Baggage Security Inspection
by: Velayudhan, Divya, et al.
Published: (2025)
by: Velayudhan, Divya, et al.
Published: (2025)
Similar Items
-
ZEAL: Surgical Skill Assessment with Zero-shot Tool Inference Using Unified Foundation Model
by: Kondo, Satoshi
Published: (2024) -
Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review
by: Lin, Haoneng, et al.
Published: (2025) -
Surgical Vision World Model
by: Koju, Saurabh, et al.
Published: (2025) -
Spatio-Temporal Representation Decoupling and Enhancement for Federated Instrument Segmentation in Surgical Videos
by: Fang, Zheng, et al.
Published: (2025) -
Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis
by: Xin, Yu, et al.
Published: (2025)