SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Guankun, Wang, Junyi, Mo, Wenjin, Bai, Long, Yuan, Kun, Hu, Ming, Wu, Jinlin, He, Junjun, Huang, Yiming, Padoy, Nicolas, Lei, Zhen, Liu, Hongbin, Navab, Nassir, Ren, Hongliang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
von: Huang, Yiming, et al.
Veröffentlicht: (2025)
von: Huang, Yiming, et al.
Veröffentlicht: (2025)
SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding
von: Chen, Zhen, et al.
Veröffentlicht: (2025)
von: Chen, Zhen, et al.
Veröffentlicht: (2025)
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
von: Yuan, Kun, et al.
Veröffentlicht: (2024)
von: Yuan, Kun, et al.
Veröffentlicht: (2024)
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
von: Yuan, Kun, et al.
Veröffentlicht: (2024)
von: Yuan, Kun, et al.
Veröffentlicht: (2024)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
von: Wang, Guankun, et al.
Veröffentlicht: (2025)
von: Wang, Guankun, et al.
Veröffentlicht: (2025)
CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition
von: Stilz, Florian, et al.
Veröffentlicht: (2026)
von: Stilz, Florian, et al.
Veröffentlicht: (2026)
SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary
von: He, Jingyi, et al.
Veröffentlicht: (2026)
von: He, Jingyi, et al.
Veröffentlicht: (2026)
SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos
von: Wu, Jinlin, et al.
Veröffentlicht: (2026)
von: Wu, Jinlin, et al.
Veröffentlicht: (2026)
HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation
von: Biagini, Diego, et al.
Veröffentlicht: (2025)
von: Biagini, Diego, et al.
Veröffentlicht: (2025)
Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis
von: Chen, Tingxuan, et al.
Veröffentlicht: (2025)
von: Chen, Tingxuan, et al.
Veröffentlicht: (2025)
SurgPLAN++: Universal Surgical Phase Localization Network for Online and Offline Inference
von: Chen, Zhen, et al.
Veröffentlicht: (2024)
von: Chen, Zhen, et al.
Veröffentlicht: (2024)
Advancing Surgical VQA with Scene Graph Knowledge
von: Yuan, Kun, et al.
Veröffentlicht: (2023)
von: Yuan, Kun, et al.
Veröffentlicht: (2023)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
von: Chen, Tong, et al.
Veröffentlicht: (2024)
von: Chen, Tong, et al.
Veröffentlicht: (2024)
Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures
von: Yuan, Kun, et al.
Veröffentlicht: (2023)
von: Yuan, Kun, et al.
Veröffentlicht: (2023)
Where It Moves, It Matters: Referring Surgical Instrument Segmentation via Motion
von: Wei, Meng, et al.
Veröffentlicht: (2026)
von: Wei, Meng, et al.
Veröffentlicht: (2026)
Recognizing Surgical Phases Anywhere: Few-Shot Test-time Adaptation and Task-graph Guided Refinement
von: Yuan, Kun, et al.
Veröffentlicht: (2025)
von: Yuan, Kun, et al.
Veröffentlicht: (2025)
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
von: Wang, Guankun, et al.
Veröffentlicht: (2024)
von: Wang, Guankun, et al.
Veröffentlicht: (2024)
Multimodal Graph Representation Learning for Robust Surgical Workflow Recognition with Adversarial Feature Disentanglement
von: Bai, Long, et al.
Veröffentlicht: (2025)
von: Bai, Long, et al.
Veröffentlicht: (2025)
SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability
von: Li, Ruochen, et al.
Veröffentlicht: (2026)
von: Li, Ruochen, et al.
Veröffentlicht: (2026)
SurgTrack: CAD-Free 3D Tracking of Real-world Surgical Instruments
von: Guo, Wenwu, et al.
Veröffentlicht: (2024)
von: Guo, Wenwu, et al.
Veröffentlicht: (2024)
Adapting SAM for Surgical Instrument Tracking and Segmentation in Endoscopic Submucosal Dissection Videos
von: Yu, Jieming, et al.
Veröffentlicht: (2024)
von: Yu, Jieming, et al.
Veröffentlicht: (2024)
ASI-Seg: Audio-Driven Surgical Instrument Segmentation with Surgeon Intention Understanding
von: Chen, Zhen, et al.
Veröffentlicht: (2024)
von: Chen, Zhen, et al.
Veröffentlicht: (2024)
SURGIVID: Annotation-Efficient Surgical Video Object Discovery
von: Köksal, Çağhan, et al.
Veröffentlicht: (2024)
von: Köksal, Çağhan, et al.
Veröffentlicht: (2024)
SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy
von: Li, Shi, et al.
Veröffentlicht: (2026)
von: Li, Shi, et al.
Veröffentlicht: (2026)
PDZSeg: Adapting the Foundation Model for Dissection Zone Segmentation with Visual Prompts in Robot-assisted Endoscopic Submucosal Dissection
von: Xu, Mengya, et al.
Veröffentlicht: (2024)
von: Xu, Mengya, et al.
Veröffentlicht: (2024)
How can reasoning capability empower the AI copilot robot in endoscopic surgery
von: Wang, Guankun, et al.
Veröffentlicht: (2026)
von: Wang, Guankun, et al.
Veröffentlicht: (2026)
Weakly Supervised YOLO Network for Surgical Instrument Localization in Endoscopic Videos
von: Wei, Rongfeng, et al.
Veröffentlicht: (2023)
von: Wei, Rongfeng, et al.
Veröffentlicht: (2023)
Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery
von: Bai, Long, et al.
Veröffentlicht: (2024)
von: Bai, Long, et al.
Veröffentlicht: (2024)
ETSM: Automating Dissection Trajectory Suggestion and Confidence Map-Based Safety Margin Prediction for Robot-assisted Endoscopic Submucosal Dissection
von: Xu, Mengya, et al.
Veröffentlicht: (2024)
von: Xu, Mengya, et al.
Veröffentlicht: (2024)
SANGRIA: Surgical Video Scene Graph Optimization for Surgical Workflow Prediction
von: Köksal, Çağhan, et al.
Veröffentlicht: (2024)
von: Köksal, Çağhan, et al.
Veröffentlicht: (2024)
How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
von: Chen, Zhen, et al.
Veröffentlicht: (2025)
von: Chen, Zhen, et al.
Veröffentlicht: (2025)
SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement
von: Lei, Zeyu, et al.
Veröffentlicht: (2025)
von: Lei, Zeyu, et al.
Veröffentlicht: (2025)
SurgiTrack: Fine-Grained Multi-Class Multi-Tool Tracking in Surgical Videos
von: Nwoye, Chinedu Innocent, et al.
Veröffentlicht: (2024)
von: Nwoye, Chinedu Innocent, et al.
Veröffentlicht: (2024)
Medical Multimodal Model Stealing Attacks via Adversarial Domain Alignment
von: Shen, Yaling, et al.
Veröffentlicht: (2025)
von: Shen, Yaling, et al.
Veröffentlicht: (2025)
Mitigating Biases in Surgical Operating Rooms with Geometry
von: Wang, Tony Danjun, et al.
Veröffentlicht: (2025)
von: Wang, Tony Danjun, et al.
Veröffentlicht: (2025)
SurgBox: Agent-Driven Operating Room Sandbox with Surgery Copilot
von: Wu, Jinlin, et al.
Veröffentlicht: (2024)
von: Wu, Jinlin, et al.
Veröffentlicht: (2024)
Advancing Dense Endoscopic Reconstruction with Gaussian Splatting-driven Surface Normal-aware Tracking and Mapping
von: Huang, Yiming, et al.
Veröffentlicht: (2025)
von: Huang, Yiming, et al.
Veröffentlicht: (2025)
OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining
von: Hu, Ming, et al.
Veröffentlicht: (2024)
von: Hu, Ming, et al.
Veröffentlicht: (2024)
Geo-RepNet: Geometry-Aware Representation Learning for Surgical Phase Recognition in Endoscopic Submucosal Dissection
von: Tang, Rui, et al.
Veröffentlicht: (2025)
von: Tang, Rui, et al.
Veröffentlicht: (2025)
ProtoFlow: Interpretable and Robust Surgical Workflow Modeling with Learned Dynamic Scene Graph Prototypes
von: Holm, Felix, et al.
Veröffentlicht: (2025)
von: Holm, Felix, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
von: Huang, Yiming, et al.
Veröffentlicht: (2025) -
SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding
von: Chen, Zhen, et al.
Veröffentlicht: (2025) -
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
von: Yuan, Kun, et al.
Veröffentlicht: (2024) -
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
von: Yuan, Kun, et al.
Veröffentlicht: (2024) -
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
von: Wang, Guankun, et al.
Veröffentlicht: (2025)