SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dhake, Shreyas C., Huang, Jiayuan, He, Runlong, Khan, Danyal Z., Mazomenos, Evangelos B., Bano, Sophia, Marcus, Hani J., Stoyanov, Danail, Clarkson, Matthew J., Hoque, Mobarak I. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Surgical AI Copilot: Energy-Based Fourier Gradient Low-Rank Adaptation for Surgical LLM Agent Reasoning and Planning
von: Huang, Jiayuan, et al.
Veröffentlicht: (2025)
von: Huang, Jiayuan, et al.
Veröffentlicht: (2025)
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
von: He, Runlong, et al.
Veröffentlicht: (2025)
von: He, Runlong, et al.
Veröffentlicht: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
von: Drago, Mauro Orazio, et al.
Veröffentlicht: (2025)
von: Drago, Mauro Orazio, et al.
Veröffentlicht: (2025)
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
von: He, Runlong, et al.
Veröffentlicht: (2024)
von: He, Runlong, et al.
Veröffentlicht: (2024)
Endo-FASt3r: Endoscopic Foundation model Adaptation for Structure from motion
von: Zeinoddin, Mona Sheikh, et al.
Veröffentlicht: (2025)
von: Zeinoddin, Mona Sheikh, et al.
Veröffentlicht: (2025)
When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA
von: Carlini, Luca, et al.
Veröffentlicht: (2025)
von: Carlini, Luca, et al.
Veröffentlicht: (2025)
SurgFusion-Net: Diversified Adaptive Multimodal Fusion Network for Surgical Skill Assessment
von: He, Runlong, et al.
Veröffentlicht: (2026)
von: He, Runlong, et al.
Veröffentlicht: (2026)
Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting
von: Song, Tianyi, et al.
Veröffentlicht: (2026)
von: Song, Tianyi, et al.
Veröffentlicht: (2026)
TemporalDoRA: Temporal PEFT for Robust Surgical Video Question Answering
von: Carlini, Luca, et al.
Veröffentlicht: (2026)
von: Carlini, Luca, et al.
Veröffentlicht: (2026)
MambaNetLK: Enhancing Colonoscopy Point Cloud Registration with Mamba
von: Jiang, Linzhe, et al.
Veröffentlicht: (2025)
von: Jiang, Linzhe, et al.
Veröffentlicht: (2025)
Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos
von: Shao, Zhimin, et al.
Veröffentlicht: (2024)
von: Shao, Zhimin, et al.
Veröffentlicht: (2024)
CoRe-DA: Contrastive Regression for Unsupervised Domain Adaptation in Surgical Skill Assessment
von: Anastasiou, Dimitrios, et al.
Veröffentlicht: (2026)
von: Anastasiou, Dimitrios, et al.
Veröffentlicht: (2026)
Depth Augmented and FE Free 3D/2D Liver Registration for Laparoscopic Liver AR
von: Zhang, Hanyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Hanyuan, et al.
Veröffentlicht: (2026)
Automated Surgical Skill Assessment in Endoscopic Pituitary Surgery using Real-time Instrument Tracking on a High-fidelity Bench-top Phantom
von: Das, Adrito, et al.
Veröffentlicht: (2024)
von: Das, Adrito, et al.
Veröffentlicht: (2024)
EndoLRMGS: Complete Endoscopic Scene Reconstruction combining Large Reconstruction Modelling and Gaussian Splatting
von: Wang, Xu, et al.
Veröffentlicht: (2025)
von: Wang, Xu, et al.
Veröffentlicht: (2025)
SEDMamba: Enhancing Selective State Space Modelling with Bottleneck Mechanism and Fine-to-Coarse Temporal Fusion for Efficient Error Detection in Robot-Assisted Surgery
von: Xu, Jialang, et al.
Veröffentlicht: (2024)
von: Xu, Jialang, et al.
Veröffentlicht: (2024)
Warm-Started Reinforcement Learning for Iterative 3D/2D Liver Registration
von: Zhang, Hanyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Hanyuan, et al.
Veröffentlicht: (2026)
EndoSfM3D: Learning to 3D Reconstruct Any Endoscopic Surgery Scene using Self-supervised Foundation Model
von: Zhang, Changhao, et al.
Veröffentlicht: (2025)
von: Zhang, Changhao, et al.
Veröffentlicht: (2025)
Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision
von: Ju, Xinwei, et al.
Veröffentlicht: (2026)
von: Ju, Xinwei, et al.
Veröffentlicht: (2026)
StereoMamba: Real-time and Robust Intraoperative Stereo Disparity Estimation via Long-range Spatial Dependencies
von: Wang, Xu, et al.
Veröffentlicht: (2025)
von: Wang, Xu, et al.
Veröffentlicht: (2025)
3D Acetabular Surface Reconstruction from 2D Pre-operative X-ray Images using SRVF Elastic Registration and Deformation Graph
von: Zhang, Shuai, et al.
Veröffentlicht: (2025)
von: Zhang, Shuai, et al.
Veröffentlicht: (2025)
Personalizing Federated Instrument Segmentation with Visual Trait Priors in Robotic Surgery
von: Xu, Jialang, et al.
Veröffentlicht: (2024)
von: Xu, Jialang, et al.
Veröffentlicht: (2024)
PitRSDNet: Predicting Intra-operative Remaining Surgery Duration in Endoscopic Pituitary Surgery
von: Wijekoon, Anjana, et al.
Veröffentlicht: (2024)
von: Wijekoon, Anjana, et al.
Veröffentlicht: (2024)
Surgical-DeSAM: Decoupling SAM for Instrument Segmentation in Robotic Surgery
von: Sheng, Yuyang, et al.
Veröffentlicht: (2024)
von: Sheng, Yuyang, et al.
Veröffentlicht: (2024)
Temporal Cluster Assignment for Efficient Real-Time Video Segmentation
von: Yung, Ka-Wai, et al.
Veröffentlicht: (2025)
von: Yung, Ka-Wai, et al.
Veröffentlicht: (2025)
Learning from Single Timestamps: Complexity Estimation in Laparoscopic Cholecystectomy
von: Anastasiou, Dimitrios, et al.
Veröffentlicht: (2025)
von: Anastasiou, Dimitrios, et al.
Veröffentlicht: (2025)
Gaussian Pancakes: Geometrically-Regularized 3D Gaussian Splatting for Realistic Endoscopic Reconstruction
von: Bonilla, Sierra, et al.
Veröffentlicht: (2024)
von: Bonilla, Sierra, et al.
Veröffentlicht: (2024)
Subsampled Randomized Fourier GaLore for Adapting Foundation Models in Depth-Driven Liver Landmark Segmentation
von: Lin, Yun-Chen, et al.
Veröffentlicht: (2025)
von: Lin, Yun-Chen, et al.
Veröffentlicht: (2025)
DARES: Depth Anything in Robotic Endoscopic Surgery with Self-supervised Vector-LoRA of the Foundation Model
von: Zeinoddin, Mona Sheikh, et al.
Veröffentlicht: (2024)
von: Zeinoddin, Mona Sheikh, et al.
Veröffentlicht: (2024)
SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis
von: Low, Chang Han, et al.
Veröffentlicht: (2025)
von: Low, Chang Han, et al.
Veröffentlicht: (2025)
SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
von: Huang, Yiming, et al.
Veröffentlicht: (2025)
von: Huang, Yiming, et al.
Veröffentlicht: (2025)
RRT-GPMP2: A Motion Planner for Mobile Robots in Complex Maze Environments
von: Meng, Jiawei, et al.
Veröffentlicht: (2024)
von: Meng, Jiawei, et al.
Veröffentlicht: (2024)
Federated Learning for Surgical Vision in Appendicitis Classification: Results of the FedSurg EndoVis 2024 Challenge
von: Kirchner, Max, et al.
Veröffentlicht: (2025)
von: Kirchner, Max, et al.
Veröffentlicht: (2025)
Mismatched: Evaluating the Limits of Image Matching Approaches and Benchmarks
von: Bonilla, Sierra, et al.
Veröffentlicht: (2024)
von: Bonilla, Sierra, et al.
Veröffentlicht: (2024)
Artificial intelligence in histopathological image analysis of central nervous system tumours: A systematic review
von: Melanie P. Jensen, et al.
Veröffentlicht: (2024)
von: Melanie P. Jensen, et al.
Veröffentlicht: (2024)
Graph Neural Networks for Surgical Scene Segmentation
von: Li, Yihan, et al.
Veröffentlicht: (2025)
von: Li, Yihan, et al.
Veröffentlicht: (2025)
Training-free Temporal Object Tracking in Surgical Videos
von: Koley, Subhadeep, et al.
Veröffentlicht: (2026)
von: Koley, Subhadeep, et al.
Veröffentlicht: (2026)
Exploring Pre-training Across Domains for Few-Shot Surgical Skill Assessment
von: Anastasiou, Dimitrios, et al.
Veröffentlicht: (2025)
von: Anastasiou, Dimitrios, et al.
Veröffentlicht: (2025)
HUP-3D: A 3D multi-view synthetic dataset for assisted-egocentric hand-ultrasound pose estimation
von: Birlo, Manuel, et al.
Veröffentlicht: (2024)
von: Birlo, Manuel, et al.
Veröffentlicht: (2024)
SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
von: Shin, Jongmin, et al.
Veröffentlicht: (2026)
von: Shin, Jongmin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Surgical AI Copilot: Energy-Based Fourier Gradient Low-Rank Adaptation for Surgical LLM Agent Reasoning and Planning
von: Huang, Jiayuan, et al.
Veröffentlicht: (2025) -
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
von: He, Runlong, et al.
Veröffentlicht: (2025) -
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
von: Drago, Mauro Orazio, et al.
Veröffentlicht: (2025) -
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
von: He, Runlong, et al.
Veröffentlicht: (2024) -
Endo-FASt3r: Endoscopic Foundation model Adaptation for Structure from motion
von: Zeinoddin, Mona Sheikh, et al.
Veröffentlicht: (2025)