From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Bohan, Yang, Shuojue, Peng, Baorui, Guo, Xianda, Zhang, Erli, Tao, Youqi, Duan, Junfeng, Xu, Daguang, Dou, Qi, Jin, Xin, Zeng, Wenjun, Zhao, Hao, Jin, Yueming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deform3DGS: Flexible Deformation for Fast Surgical Scene Reconstruction with Gaussian Splatting
di: Yang, Shuojue, et al.
Pubblicazione: (2024)
di: Yang, Shuojue, et al.
Pubblicazione: (2024)
Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning
di: Liu, Haofeng, et al.
Pubblicazione: (2024)
di: Liu, Haofeng, et al.
Pubblicazione: (2024)
ToolTipNet: A Segmentation-Driven Deep Learning Baseline for Surgical Instrument Tip Detection
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation
di: Shen, Daiyun, et al.
Pubblicazione: (2026)
di: Shen, Daiyun, et al.
Pubblicazione: (2026)
Free-DyGS: Camera-Pose-Free Scene Reconstruction for Dynamic Surgical Videos with Gaussian Splatting
di: Li, Qian, et al.
Pubblicazione: (2024)
di: Li, Qian, et al.
Pubblicazione: (2024)
OmniNWM: Omniscient Driving Navigation World Models
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
Instrument-Splatting: Controllable Photorealistic Reconstruction of Surgical Instruments Using Gaussian Splatting
di: Yang, Shuojue, et al.
Pubblicazione: (2025)
di: Yang, Shuojue, et al.
Pubblicazione: (2025)
BCRNet: Enhancing Landmark Detection in Laparoscopic Liver Surgery via Bezier Curve Refinement
di: Li, Qian, et al.
Pubblicazione: (2025)
di: Li, Qian, et al.
Pubblicazione: (2025)
Instrument-Splatting++: Towards Controllable Surgical Instrument Digital Twin Using Gaussian Splatting
di: Yang, Shuojue, et al.
Pubblicazione: (2026)
di: Yang, Shuojue, et al.
Pubblicazione: (2026)
Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
di: He, Yufan, et al.
Pubblicazione: (2025)
di: He, Yufan, et al.
Pubblicazione: (2025)
Spatio-Temporal Representation Decoupling and Enhancement for Federated Instrument Segmentation in Surgical Videos
di: Fang, Zheng, et al.
Pubblicazione: (2025)
di: Fang, Zheng, et al.
Pubblicazione: (2025)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
di: Peng, Baorui, et al.
Pubblicazione: (2026)
di: Peng, Baorui, et al.
Pubblicazione: (2026)
Articulated Kinematics Distillation from Video Diffusion Models
di: Li, Xuan, et al.
Pubblicazione: (2025)
di: Li, Xuan, et al.
Pubblicazione: (2025)
SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
di: Zeng, Zhitao, et al.
Pubblicazione: (2025)
di: Zeng, Zhitao, et al.
Pubblicazione: (2025)
SurgCalib: Gaussian Splatting-Based Hand-Eye Calibration for Robot-Assisted Minimally Invasive Surgery
di: Wu, Zijian, et al.
Pubblicazione: (2026)
di: Wu, Zijian, et al.
Pubblicazione: (2026)
Generalized Recognition of Basic Surgical Actions Enables Skill Assessment and Vision-Language-Model-based Surgical Planning
di: Xu, Mengya, et al.
Pubblicazione: (2026)
di: Xu, Mengya, et al.
Pubblicazione: (2026)
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026)
di: Yang, Zhaoyang, et al.
Pubblicazione: (2026)
Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence
di: Zeng, Zhitao, et al.
Pubblicazione: (2026)
di: Zeng, Zhitao, et al.
Pubblicazione: (2026)
Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos
di: Shao, Zhimin, et al.
Pubblicazione: (2024)
di: Shao, Zhimin, et al.
Pubblicazione: (2024)
Kinematic-Based Assessment of Surgical Actions in Microanastomosis
di: Meng, Yan, et al.
Pubblicazione: (2025)
di: Meng, Yan, et al.
Pubblicazione: (2025)
SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis
di: Low, Chang Han, et al.
Pubblicazione: (2025)
di: Low, Chang Han, et al.
Pubblicazione: (2025)
Systematic Evaluation and Guidelines for Segment Anything Model in Surgical Video Analysis
di: Yuan, Cheng, et al.
Pubblicazione: (2024)
di: Yuan, Cheng, et al.
Pubblicazione: (2024)
Hierarchical Context Alignment with Disentangled Geometric and Temporal Modeling for Semantic Occupancy Prediction
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
di: Wang, Qi, et al.
Pubblicazione: (2023)
di: Wang, Qi, et al.
Pubblicazione: (2023)
Surgical Action Planning with Large Language Models
di: Xu, Mengya, et al.
Pubblicazione: (2025)
di: Xu, Mengya, et al.
Pubblicazione: (2025)
Temporally Guided Articulated Hand Pose Tracking in Surgical Videos
di: Louis, Nathan, et al.
Pubblicazione: (2021)
di: Louis, Nathan, et al.
Pubblicazione: (2021)
SurgiPose: Estimating Surgical Tool Kinematics from Monocular Video for Surgical Robot Learning
di: Chen, Juo-Tung, et al.
Pubblicazione: (2025)
di: Chen, Juo-Tung, et al.
Pubblicazione: (2025)
Closed-Loop Unsupervised Representation Disentanglement with $β$-VAE Distillation and Diffusion Probabilistic Feedback
di: Jin, Xin, et al.
Pubblicazione: (2024)
di: Jin, Xin, et al.
Pubblicazione: (2024)
SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation
di: Rapuri, Sampath, et al.
Pubblicazione: (2026)
di: Rapuri, Sampath, et al.
Pubblicazione: (2026)
SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding
di: Fang, Zheng, et al.
Pubblicazione: (2026)
di: Fang, Zheng, et al.
Pubblicazione: (2026)
ReSurgSAM2: Referring Segment Anything in Surgical Video via Credible Long-term Tracking
di: Liu, Haofeng, et al.
Pubblicazione: (2025)
di: Liu, Haofeng, et al.
Pubblicazione: (2025)
RefDecoder: Enhancing Visual Generation with Conditional Video Decoding
di: Fan, Xiang, et al.
Pubblicazione: (2026)
di: Fan, Xiang, et al.
Pubblicazione: (2026)
AU-vMAE: Knowledge-Guide Action Units Detection via Video Masked Autoencoder
di: Jin, Qiaoqiao, et al.
Pubblicazione: (2024)
di: Jin, Qiaoqiao, et al.
Pubblicazione: (2024)
Hierarchical Temporal Context Learning for Camera-based Semantic Scene Completion
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
One at a Time: Progressive Multi-step Volumetric Probability Learning for Reliable 3D Scene Perception
di: Li, Bohan, et al.
Pubblicazione: (2023)
di: Li, Bohan, et al.
Pubblicazione: (2023)
NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic Navigation
di: Xie, Baao, et al.
Pubblicazione: (2023)
di: Xie, Baao, et al.
Pubblicazione: (2023)
VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems
di: Liu, Shiyan, et al.
Pubblicazione: (2025)
di: Liu, Shiyan, et al.
Pubblicazione: (2025)
SAM2S: Segment Anything in Surgical Videos via Semantic Long-term Tracking
di: Liu, Haofeng, et al.
Pubblicazione: (2025)
di: Liu, Haofeng, et al.
Pubblicazione: (2025)
VideoArtGS: Building Digital Twins of Articulated Objects from Monocular Video
di: Liu, Yu, et al.
Pubblicazione: (2025)
di: Liu, Yu, et al.
Pubblicazione: (2025)
MViewRouter: Internalizing Geometric Equivariance via Multi-view Alternating Attention for Combinatorial Routing
di: Liu, Shiyan, et al.
Pubblicazione: (2026)
di: Liu, Shiyan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Deform3DGS: Flexible Deformation for Fast Surgical Scene Reconstruction with Gaussian Splatting
di: Yang, Shuojue, et al.
Pubblicazione: (2024) -
Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning
di: Liu, Haofeng, et al.
Pubblicazione: (2024) -
ToolTipNet: A Segmentation-Driven Deep Learning Baseline for Surgical Instrument Tip Detection
di: Wu, Zijian, et al.
Pubblicazione: (2025) -
SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation
di: Shen, Daiyun, et al.
Pubblicazione: (2026) -
Free-DyGS: Camera-Pose-Free Scene Reconstruction for Dynamic Surgical Videos with Gaussian Splatting
di: Li, Qian, et al.
Pubblicazione: (2024)