Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Diandian, Lin, Manxi, Pei, Jialun, Tang, He, Jin, Yueming, Heng, Pheng-Ann |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR
por: Pei, Jialun, et al.
Publicado: (2024)
por: Pei, Jialun, et al.
Publicado: (2024)
Surgical Workflow Recognition and Blocking Effectiveness Detection in Laparoscopic Liver Resections with Pringle Maneuver
por: Guo, Diandian, et al.
Publicado: (2024)
por: Guo, Diandian, et al.
Publicado: (2024)
SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
por: Guo, Diandian, et al.
Publicado: (2026)
por: Guo, Diandian, et al.
Publicado: (2026)
CalibNet: Dual-branch Cross-modal Calibration for RGB-D Salient Instance Segmentation
por: Pei, Jialun, et al.
Publicado: (2023)
por: Pei, Jialun, et al.
Publicado: (2023)
Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos
por: Pei, Jialun, et al.
Publicado: (2025)
por: Pei, Jialun, et al.
Publicado: (2025)
Attenuation-Resilient Alternating Optimization for Laparoscopic Liver Landmark Detection
por: Liu, Lanqing, et al.
Publicado: (2026)
por: Liu, Lanqing, et al.
Publicado: (2026)
Benchmarking Endoscopic Surgical Image Restoration and Beyond
por: Pei, Jialun, et al.
Publicado: (2025)
por: Pei, Jialun, et al.
Publicado: (2025)
Epicardium Prompt-guided Real-time Cardiac Ultrasound Frame-to-volume Registration
por: Lei, Long, et al.
Publicado: (2024)
por: Lei, Long, et al.
Publicado: (2024)
Depth-Driven Geometric Prompt Learning for Laparoscopic Liver Landmark Detection
por: Pei, Jialun, et al.
Publicado: (2024)
por: Pei, Jialun, et al.
Publicado: (2024)
Topology-Constrained Learning for Efficient Laparoscopic Liver Landmark Detection
por: Cui, Ruize, et al.
Publicado: (2025)
por: Cui, Ruize, et al.
Publicado: (2025)
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
por: Song, Quanjian, et al.
Publicado: (2025)
por: Song, Quanjian, et al.
Publicado: (2025)
Landmark-Free Preoperative-to-Intraoperative Registration in Laparoscopic Liver Resection
por: Zhou, Jun, et al.
Publicado: (2025)
por: Zhou, Jun, et al.
Publicado: (2025)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
por: Xu, Dunyuan, et al.
Publicado: (2024)
por: Xu, Dunyuan, et al.
Publicado: (2024)
MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization
por: Zhang, Yiyi, et al.
Publicado: (2025)
por: Zhang, Yiyi, et al.
Publicado: (2025)
Does Engram Do Memory Retrieval in Autoregressive Image Generation?
por: Wang, Jinghao, et al.
Publicado: (2026)
por: Wang, Jinghao, et al.
Publicado: (2026)
Spatio-Temporal Representation Decoupling and Enhancement for Federated Instrument Segmentation in Surgical Videos
por: Fang, Zheng, et al.
Publicado: (2025)
por: Fang, Zheng, et al.
Publicado: (2025)
Preoperative-to-intraoperative Liver Registration for Laparoscopic Surgery via Latent-Grounded Correspondence Constraints
por: Cui, Ruize, et al.
Publicado: (2026)
por: Cui, Ruize, et al.
Publicado: (2026)
MS2Mesh-XR: Multi-modal Sketch-to-Mesh Generation in XR Environments
por: Tong, Yuqi, et al.
Publicado: (2024)
por: Tong, Yuqi, et al.
Publicado: (2024)
Rethinking Detecting Salient and Camouflaged Objects in Unconstrained Scenes
por: Zhou, Zhangjun, et al.
Publicado: (2024)
por: Zhou, Zhangjun, et al.
Publicado: (2024)
Adaptive Negative Evidential Deep Learning for Open-set Semi-supervised Learning
por: Yu, Yang, et al.
Publicado: (2023)
por: Yu, Yang, et al.
Publicado: (2023)
Salient Temporal Encoding for Dynamic Scene Graph Generation
por: Zhu, Zhihao
Publicado: (2025)
por: Zhu, Zhihao
Publicado: (2025)
SpecGen: Neural Spectral BRDF Generation via Spectral-Spatial Tri-plane Aggregation
por: Jin, Zhenyu, et al.
Publicado: (2025)
por: Jin, Zhenyu, et al.
Publicado: (2025)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
Comprehensive Generative Replay for Task-Incremental Segmentation with Concurrent Appearance and Semantic Forgetting
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
Deep Omni-supervised Learning for Rib Fracture Detection from Chest Radiology Images
por: Chai, Zhizhong, et al.
Publicado: (2023)
por: Chai, Zhizhong, et al.
Publicado: (2023)
Vanishing-Point-Guided Video Semantic Segmentation of Driving Scenes
por: Guo, Diandian, et al.
Publicado: (2024)
por: Guo, Diandian, et al.
Publicado: (2024)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
por: Guo, Ziyu, et al.
Publicado: (2026)
por: Guo, Ziyu, et al.
Publicado: (2026)
Towards Synchronous Memorizability and Generalizability with Site-Modulated Diffusion Replay for Cross-Site Continual Segmentation
por: Xu, Dunyuan, et al.
Publicado: (2024)
por: Xu, Dunyuan, et al.
Publicado: (2024)
Unifying Physically-Informed Weather Priors in A Single Model for Image Restoration Across Multiple Adverse Weather Conditions
por: Xu, Jiaqi, et al.
Publicado: (2026)
por: Xu, Jiaqi, et al.
Publicado: (2026)
Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework
por: Zhu, Yu, et al.
Publicado: (2026)
por: Zhu, Yu, et al.
Publicado: (2026)
Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting
por: Zhu, Runsong, et al.
Publicado: (2025)
por: Zhu, Runsong, et al.
Publicado: (2025)
TopoOR: A Unified Topological Scene Representation for the Operating Room
por: Wang, Tony Danjun, et al.
Publicado: (2026)
por: Wang, Tony Danjun, et al.
Publicado: (2026)
Generalized Unbiased Scene Graph Generation
por: Lyu, Xinyu, et al.
Publicado: (2023)
por: Lyu, Xinyu, et al.
Publicado: (2023)
Informative Scene Graph Generation via Debiasing
por: Gao, Lianli, et al.
Publicado: (2023)
por: Gao, Lianli, et al.
Publicado: (2023)
Decoupling Feature Representations of Ego and Other Modalities for Incomplete Multi-modal Brain Tumor Segmentation
por: Yang, Kaixiang, et al.
Publicado: (2024)
por: Yang, Kaixiang, et al.
Publicado: (2024)
UniHOPE: A Unified Approach for Hand-Only and Hand-Object Pose Estimation
por: Wang, Yinqiao, et al.
Publicado: (2025)
por: Wang, Yinqiao, et al.
Publicado: (2025)
SiMA-Hand: Boosting 3D Hand-Mesh Reconstruction by Single-to-Multi-View Adaptation
por: Wang, Yinqiao, et al.
Publicado: (2024)
por: Wang, Yinqiao, et al.
Publicado: (2024)
Out of the Room: Generalizing Event-Based Dynamic Motion Segmentation for Complex Scenes
por: Georgoulis, Stamatios, et al.
Publicado: (2024)
por: Georgoulis, Stamatios, et al.
Publicado: (2024)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
FloCoDe: Unbiased Dynamic Scene Graph Generation with Temporal Consistency and Correlation Debiasing
por: Khandelwal, Anant
Publicado: (2023)
por: Khandelwal, Anant
Publicado: (2023)
Ejemplares similares
-
S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR
por: Pei, Jialun, et al.
Publicado: (2024) -
Surgical Workflow Recognition and Blocking Effectiveness Detection in Laparoscopic Liver Resections with Pringle Maneuver
por: Guo, Diandian, et al.
Publicado: (2024) -
SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
por: Guo, Diandian, et al.
Publicado: (2026) -
CalibNet: Dual-branch Cross-modal Calibration for RGB-D Salient Instance Segmentation
por: Pei, Jialun, et al.
Publicado: (2023) -
Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos
por: Pei, Jialun, et al.
Publicado: (2025)