From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Bohan, Yang, Shuojue, Peng, Baorui, Guo, Xianda, Zhang, Erli, Tao, Youqi, Duan, Junfeng, Xu, Daguang, Dou, Qi, Jin, Xin, Zeng, Wenjun, Zhao, Hao, Jin, Yueming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deform3DGS: Flexible Deformation for Fast Surgical Scene Reconstruction with Gaussian Splatting
par: Yang, Shuojue, et autres
Publié: (2024)
par: Yang, Shuojue, et autres
Publié: (2024)
Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning
par: Liu, Haofeng, et autres
Publié: (2024)
par: Liu, Haofeng, et autres
Publié: (2024)
ToolTipNet: A Segmentation-Driven Deep Learning Baseline for Surgical Instrument Tip Detection
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation
par: Shen, Daiyun, et autres
Publié: (2026)
par: Shen, Daiyun, et autres
Publié: (2026)
Free-DyGS: Camera-Pose-Free Scene Reconstruction for Dynamic Surgical Videos with Gaussian Splatting
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
OmniNWM: Omniscient Driving Navigation World Models
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
Instrument-Splatting: Controllable Photorealistic Reconstruction of Surgical Instruments Using Gaussian Splatting
par: Yang, Shuojue, et autres
Publié: (2025)
par: Yang, Shuojue, et autres
Publié: (2025)
BCRNet: Enhancing Landmark Detection in Laparoscopic Liver Surgery via Bezier Curve Refinement
par: Li, Qian, et autres
Publié: (2025)
par: Li, Qian, et autres
Publié: (2025)
Instrument-Splatting++: Towards Controllable Surgical Instrument Digital Twin Using Gaussian Splatting
par: Yang, Shuojue, et autres
Publié: (2026)
par: Yang, Shuojue, et autres
Publié: (2026)
Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
par: He, Yufan, et autres
Publié: (2025)
par: He, Yufan, et autres
Publié: (2025)
Spatio-Temporal Representation Decoupling and Enhancement for Federated Instrument Segmentation in Surgical Videos
par: Fang, Zheng, et autres
Publié: (2025)
par: Fang, Zheng, et autres
Publié: (2025)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
par: Peng, Baorui, et autres
Publié: (2026)
par: Peng, Baorui, et autres
Publié: (2026)
Articulated Kinematics Distillation from Video Diffusion Models
par: Li, Xuan, et autres
Publié: (2025)
par: Li, Xuan, et autres
Publié: (2025)
SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
par: Zeng, Zhitao, et autres
Publié: (2025)
par: Zeng, Zhitao, et autres
Publié: (2025)
SurgCalib: Gaussian Splatting-Based Hand-Eye Calibration for Robot-Assisted Minimally Invasive Surgery
par: Wu, Zijian, et autres
Publié: (2026)
par: Wu, Zijian, et autres
Publié: (2026)
Generalized Recognition of Basic Surgical Actions Enables Skill Assessment and Vision-Language-Model-based Surgical Planning
par: Xu, Mengya, et autres
Publié: (2026)
par: Xu, Mengya, et autres
Publié: (2026)
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
par: Yang, Zhaoyang, et autres
Publié: (2026)
par: Yang, Zhaoyang, et autres
Publié: (2026)
Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence
par: Zeng, Zhitao, et autres
Publié: (2026)
par: Zeng, Zhitao, et autres
Publié: (2026)
Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos
par: Shao, Zhimin, et autres
Publié: (2024)
par: Shao, Zhimin, et autres
Publié: (2024)
Kinematic-Based Assessment of Surgical Actions in Microanastomosis
par: Meng, Yan, et autres
Publié: (2025)
par: Meng, Yan, et autres
Publié: (2025)
SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis
par: Low, Chang Han, et autres
Publié: (2025)
par: Low, Chang Han, et autres
Publié: (2025)
Systematic Evaluation and Guidelines for Segment Anything Model in Surgical Video Analysis
par: Yuan, Cheng, et autres
Publié: (2024)
par: Yuan, Cheng, et autres
Publié: (2024)
Hierarchical Context Alignment with Disentangled Geometric and Temporal Modeling for Semantic Occupancy Prediction
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
par: Wang, Qi, et autres
Publié: (2023)
par: Wang, Qi, et autres
Publié: (2023)
Surgical Action Planning with Large Language Models
par: Xu, Mengya, et autres
Publié: (2025)
par: Xu, Mengya, et autres
Publié: (2025)
Temporally Guided Articulated Hand Pose Tracking in Surgical Videos
par: Louis, Nathan, et autres
Publié: (2021)
par: Louis, Nathan, et autres
Publié: (2021)
SurgiPose: Estimating Surgical Tool Kinematics from Monocular Video for Surgical Robot Learning
par: Chen, Juo-Tung, et autres
Publié: (2025)
par: Chen, Juo-Tung, et autres
Publié: (2025)
Closed-Loop Unsupervised Representation Disentanglement with $β$-VAE Distillation and Diffusion Probabilistic Feedback
par: Jin, Xin, et autres
Publié: (2024)
par: Jin, Xin, et autres
Publié: (2024)
SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation
par: Rapuri, Sampath, et autres
Publié: (2026)
par: Rapuri, Sampath, et autres
Publié: (2026)
SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding
par: Fang, Zheng, et autres
Publié: (2026)
par: Fang, Zheng, et autres
Publié: (2026)
ReSurgSAM2: Referring Segment Anything in Surgical Video via Credible Long-term Tracking
par: Liu, Haofeng, et autres
Publié: (2025)
par: Liu, Haofeng, et autres
Publié: (2025)
RefDecoder: Enhancing Visual Generation with Conditional Video Decoding
par: Fan, Xiang, et autres
Publié: (2026)
par: Fan, Xiang, et autres
Publié: (2026)
AU-vMAE: Knowledge-Guide Action Units Detection via Video Masked Autoencoder
par: Jin, Qiaoqiao, et autres
Publié: (2024)
par: Jin, Qiaoqiao, et autres
Publié: (2024)
Hierarchical Temporal Context Learning for Camera-based Semantic Scene Completion
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
One at a Time: Progressive Multi-step Volumetric Probability Learning for Reliable 3D Scene Perception
par: Li, Bohan, et autres
Publié: (2023)
par: Li, Bohan, et autres
Publié: (2023)
NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic Navigation
par: Xie, Baao, et autres
Publié: (2023)
par: Xie, Baao, et autres
Publié: (2023)
VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems
par: Liu, Shiyan, et autres
Publié: (2025)
par: Liu, Shiyan, et autres
Publié: (2025)
SAM2S: Segment Anything in Surgical Videos via Semantic Long-term Tracking
par: Liu, Haofeng, et autres
Publié: (2025)
par: Liu, Haofeng, et autres
Publié: (2025)
VideoArtGS: Building Digital Twins of Articulated Objects from Monocular Video
par: Liu, Yu, et autres
Publié: (2025)
par: Liu, Yu, et autres
Publié: (2025)
MViewRouter: Internalizing Geometric Equivariance via Multi-view Alternating Attention for Combinatorial Routing
par: Liu, Shiyan, et autres
Publié: (2026)
par: Liu, Shiyan, et autres
Publié: (2026)
Documents similaires
-
Deform3DGS: Flexible Deformation for Fast Surgical Scene Reconstruction with Gaussian Splatting
par: Yang, Shuojue, et autres
Publié: (2024) -
Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning
par: Liu, Haofeng, et autres
Publié: (2024) -
ToolTipNet: A Segmentation-Driven Deep Learning Baseline for Surgical Instrument Tip Detection
par: Wu, Zijian, et autres
Publié: (2025) -
SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation
par: Shen, Daiyun, et autres
Publié: (2026) -
Free-DyGS: Camera-Pose-Free Scene Reconstruction for Dynamic Surgical Videos with Gaussian Splatting
par: Li, Qian, et autres
Publié: (2024)