Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Shao, Zhimin, Xu, Jialang, Stoyanov, Danail, Mazomenos, Evangelos B., Jin, Yueming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Personalizing Federated Instrument Segmentation with Visual Trait Priors in Robotic Surgery
por: Xu, Jialang, et al.
Publicado: (2024)
por: Xu, Jialang, et al.
Publicado: (2024)
Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting
por: Song, Tianyi, et al.
Publicado: (2026)
por: Song, Tianyi, et al.
Publicado: (2026)
SEDMamba: Enhancing Selective State Space Modelling with Bottleneck Mechanism and Fine-to-Coarse Temporal Fusion for Efficient Error Detection in Robot-Assisted Surgery
por: Xu, Jialang, et al.
Publicado: (2024)
por: Xu, Jialang, et al.
Publicado: (2024)
Temporal Cluster Assignment for Efficient Real-Time Video Segmentation
por: Yung, Ka-Wai, et al.
Publicado: (2025)
por: Yung, Ka-Wai, et al.
Publicado: (2025)
StereoMamba: Real-time and Robust Intraoperative Stereo Disparity Estimation via Long-range Spatial Dependencies
por: Wang, Xu, et al.
Publicado: (2025)
por: Wang, Xu, et al.
Publicado: (2025)
3D Acetabular Surface Reconstruction from 2D Pre-operative X-ray Images using SRVF Elastic Registration and Deformation Graph
por: Zhang, Shuai, et al.
Publicado: (2025)
por: Zhang, Shuai, et al.
Publicado: (2025)
CoRe-DA: Contrastive Regression for Unsupervised Domain Adaptation in Surgical Skill Assessment
por: Anastasiou, Dimitrios, et al.
Publicado: (2026)
por: Anastasiou, Dimitrios, et al.
Publicado: (2026)
EndoLRMGS: Complete Endoscopic Scene Reconstruction combining Large Reconstruction Modelling and Gaussian Splatting
por: Wang, Xu, et al.
Publicado: (2025)
por: Wang, Xu, et al.
Publicado: (2025)
Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
por: He, Yufan, et al.
Publicado: (2025)
por: He, Yufan, et al.
Publicado: (2025)
Surgical AI Copilot: Energy-Based Fourier Gradient Low-Rank Adaptation for Surgical LLM Agent Reasoning and Planning
por: Huang, Jiayuan, et al.
Publicado: (2025)
por: Huang, Jiayuan, et al.
Publicado: (2025)
Learning from Single Timestamps: Complexity Estimation in Laparoscopic Cholecystectomy
por: Anastasiou, Dimitrios, et al.
Publicado: (2025)
por: Anastasiou, Dimitrios, et al.
Publicado: (2025)
Robotic Arm Platform for Multi-View Image Acquisition and 3D Reconstruction in Minimally Invasive Surgery
por: Saikia, Alexander, et al.
Publicado: (2024)
por: Saikia, Alexander, et al.
Publicado: (2024)
Training-free Temporal Object Tracking in Surgical Videos
por: Koley, Subhadeep, et al.
Publicado: (2026)
por: Koley, Subhadeep, et al.
Publicado: (2026)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
por: Li, Haoyuan, et al.
Publicado: (2026)
por: Li, Haoyuan, et al.
Publicado: (2026)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
por: Dissanayake, Dinura, et al.
Publicado: (2025)
por: Dissanayake, Dinura, et al.
Publicado: (2025)
SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis
por: Low, Chang Han, et al.
Publicado: (2025)
por: Low, Chang Han, et al.
Publicado: (2025)
A Step Toward World Models: A Survey on Robotic Manipulation
por: Zhang, Peng-Fei, et al.
Publicado: (2025)
por: Zhang, Peng-Fei, et al.
Publicado: (2025)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning
por: Liu, Haofeng, et al.
Publicado: (2024)
por: Liu, Haofeng, et al.
Publicado: (2024)
This&That: Language-Gesture Controlled Video Generation for Robot Planning
por: Wang, Boyang, et al.
Publicado: (2024)
por: Wang, Boyang, et al.
Publicado: (2024)
Endo-FASt3r: Endoscopic Foundation model Adaptation for Structure from motion
por: Zeinoddin, Mona Sheikh, et al.
Publicado: (2025)
por: Zeinoddin, Mona Sheikh, et al.
Publicado: (2025)
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
por: Yao, Yuanqi, et al.
Publicado: (2025)
por: Yao, Yuanqi, et al.
Publicado: (2025)
Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning
por: Bardhan, Jai, et al.
Publicado: (2026)
por: Bardhan, Jai, et al.
Publicado: (2026)
Instrument-Splatting: Controllable Photorealistic Reconstruction of Surgical Instruments Using Gaussian Splatting
por: Yang, Shuojue, et al.
Publicado: (2025)
por: Yang, Shuojue, et al.
Publicado: (2025)
$π$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs
por: Wang, Siting, et al.
Publicado: (2026)
por: Wang, Siting, et al.
Publicado: (2026)
SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention
por: Dhake, Shreyas C., et al.
Publicado: (2025)
por: Dhake, Shreyas C., et al.
Publicado: (2025)
SurgicalGS: Dynamic 3D Gaussian Splatting for Accurate Robotic-Assisted Surgical Scene Reconstruction
por: Chen, Jialei, et al.
Publicado: (2024)
por: Chen, Jialei, et al.
Publicado: (2024)
DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
por: Ishaq, Ayesha, et al.
Publicado: (2025)
por: Ishaq, Ayesha, et al.
Publicado: (2025)
Evaluating Pointing Gestures for Target Selection in Human-Robot Collaboration
por: Sassali, Noora, et al.
Publicado: (2025)
por: Sassali, Noora, et al.
Publicado: (2025)
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
por: He, Runlong, et al.
Publicado: (2025)
por: He, Runlong, et al.
Publicado: (2025)
SurgCalib: Gaussian Splatting-Based Hand-Eye Calibration for Robot-Assisted Minimally Invasive Surgery
por: Wu, Zijian, et al.
Publicado: (2026)
por: Wu, Zijian, et al.
Publicado: (2026)
Depth Augmented and FE Free 3D/2D Liver Registration for Laparoscopic Liver AR
por: Zhang, Hanyuan, et al.
Publicado: (2026)
por: Zhang, Hanyuan, et al.
Publicado: (2026)
Language-Conditioned Robotic Manipulation with Fast and Slow Thinking
por: Zhu, Minjie, et al.
Publicado: (2024)
por: Zhu, Minjie, et al.
Publicado: (2024)
Warm-Started Reinforcement Learning for Iterative 3D/2D Liver Registration
por: Zhang, Hanyuan, et al.
Publicado: (2026)
por: Zhang, Hanyuan, et al.
Publicado: (2026)
StepAL: Step-aware Active Learning for Cataract Surgical Videos
por: Shah, Nisarg A., et al.
Publicado: (2025)
por: Shah, Nisarg A., et al.
Publicado: (2025)
Ultra-Range Gesture Recognition using a Web-Camera in Human-Robot Interaction
por: Bamani, Eran, et al.
Publicado: (2023)
por: Bamani, Eran, et al.
Publicado: (2023)
Need for Speed: Zero-Shot Depth Completion with Single-Step Diffusion
por: Gregorek, Jakub, et al.
Publicado: (2026)
por: Gregorek, Jakub, et al.
Publicado: (2026)
Exploiting Radiance Fields for Grasp Generation on Novel Synthetic Views
por: Kashyap, Abhishek, et al.
Publicado: (2025)
por: Kashyap, Abhishek, et al.
Publicado: (2025)
SurgRIPE challenge: Benchmark of Surgical Robot Instrument Pose Estimation
por: Xu, Haozheng, et al.
Publicado: (2025)
por: Xu, Haozheng, et al.
Publicado: (2025)
Efficient Surgical Robotic Instrument Pose Reconstruction in Real World Conditions Using Unified Feature Detection
por: Liang, Zekai, et al.
Publicado: (2025)
por: Liang, Zekai, et al.
Publicado: (2025)
Ejemplares similares
-
Personalizing Federated Instrument Segmentation with Visual Trait Priors in Robotic Surgery
por: Xu, Jialang, et al.
Publicado: (2024) -
Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting
por: Song, Tianyi, et al.
Publicado: (2026) -
SEDMamba: Enhancing Selective State Space Modelling with Bottleneck Mechanism and Fine-to-Coarse Temporal Fusion for Efficient Error Detection in Robot-Assisted Surgery
por: Xu, Jialang, et al.
Publicado: (2024) -
Temporal Cluster Assignment for Efficient Real-Time Video Segmentation
por: Yung, Ka-Wai, et al.
Publicado: (2025) -
StereoMamba: Real-time and Robust Intraoperative Stereo Disparity Estimation via Long-range Spatial Dependencies
por: Wang, Xu, et al.
Publicado: (2025)