MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Özsoy, Ege, Pellegrini, Chantal, Czempiel, Tobias, Tristram, Felix, Yuan, Kun, Bani-Harouni, David, Eck, Ulrich, Busam, Benjamin, Keicher, Matthias, Navab, Nassir |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Specialized Foundation Models for Intelligent Operating Rooms
par: Özsoy, Ege, et autres
Publié: (2025)
par: Özsoy, Ege, et autres
Publié: (2025)
EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding
par: Özsoy, Ege, et autres
Publié: (2025)
par: Özsoy, Ege, et autres
Publié: (2025)
Language Agents for Hypothesis-driven Clinical Decision Making with Reinforcement Learning
par: Bani-Harouni, David, et autres
Publié: (2025)
par: Bani-Harouni, David, et autres
Publié: (2025)
EHR2Path: Scalable Modeling of Longitudinal Patient Pathways from Multimodal Electronic Health Records
par: Pellegrini, Chantal, et autres
Publié: (2025)
par: Pellegrini, Chantal, et autres
Publié: (2025)
RaDialog: A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance
par: Pellegrini, Chantal, et autres
Publié: (2023)
par: Pellegrini, Chantal, et autres
Publié: (2023)
ORacle: Large Vision-Language Models for Knowledge-Guided Holistic OR Domain Modeling
par: Özsoy, Ege, et autres
Publié: (2024)
par: Özsoy, Ege, et autres
Publié: (2024)
Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models
par: Bani-Harouni, David, et autres
Publié: (2025)
par: Bani-Harouni, David, et autres
Publié: (2025)
Location-Free Scene Graph Generation
par: Özsoy, Ege, et autres
Publié: (2023)
par: Özsoy, Ege, et autres
Publié: (2023)
Prototype-Based Knowledge Guidance for Fine-Grained Structured Radiology Reporting
par: Pellegrini, Chantal, et autres
Publié: (2026)
par: Pellegrini, Chantal, et autres
Publié: (2026)
MAGDA: Multi-agent guideline-driven diagnostic assistance
par: Bani-Harouni, David, et autres
Publié: (2024)
par: Bani-Harouni, David, et autres
Publié: (2024)
Mitigating Biases in Surgical Operating Rooms with Geometry
par: Wang, Tony Danjun, et autres
Publié: (2025)
par: Wang, Tony Danjun, et autres
Publié: (2025)
PanORama: Multiview Consistent Panoptic Segmentation in Operating Rooms
par: Gürbüz, Tuna, et autres
Publié: (2026)
par: Gürbüz, Tuna, et autres
Publié: (2026)
Beyond Role-Based Surgical Domain Modeling: Generalizable Re-Identification in the Operating Room
par: Wang, Tony Danjun, et autres
Publié: (2025)
par: Wang, Tony Danjun, et autres
Publié: (2025)
Learning Diagnostic Reasoning for Decision Support in Toxicology
par: Oberländer, Nico, et autres
Publié: (2026)
par: Oberländer, Nico, et autres
Publié: (2026)
Calibrated Confidence Expression for Radiology Report Generation
par: Bani-Harouni, David, et autres
Publié: (2026)
par: Bani-Harouni, David, et autres
Publié: (2026)
SpeechCT-CLIP: Distilling Text-Image Knowledge to Speech for Voice-Native Multimodal CT Analysis
par: Buess, Lukas, et autres
Publié: (2025)
par: Buess, Lukas, et autres
Publié: (2025)
PhenoKG: Knowledge Graph-Driven Gene Discovery and Patient Insights from Phenotypes Alone
par: Zaripova, Kamilia, et autres
Publié: (2025)
par: Zaripova, Kamilia, et autres
Publié: (2025)
Knowledge Graph Sparsification for GNN-based Rare Disease Diagnosis
par: Cara, Premt, et autres
Publié: (2025)
par: Cara, Premt, et autres
Publié: (2025)
Enhancing Patient Acceptance of Robotic Ultrasound through Conversational Virtual Agent and Immersive Visualizations
par: Song, Tianyu, et autres
Publié: (2025)
par: Song, Tianyu, et autres
Publié: (2025)
FLex: Joint Pose and Dynamic Radiance Fields Optimization for Stereo Endoscopic Videos
par: Stilz, Florian Philipp, et autres
Publié: (2024)
par: Stilz, Florian Philipp, et autres
Publié: (2024)
MS-CLR: Multi-Skeleton Contrastive Learning for Human Action Recognition
par: Kiray, Mert, et autres
Publié: (2025)
par: Kiray, Mert, et autres
Publié: (2025)
PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks
par: Elskhawy, Abdelrahman, et autres
Publié: (2025)
par: Elskhawy, Abdelrahman, et autres
Publié: (2025)
PromptVFX: Text-Driven Fields for Open-World 3D Gaussian Animation
par: Kiray, Mert, et autres
Publié: (2025)
par: Kiray, Mert, et autres
Publié: (2025)
Sonify Anything: Towards Context-Aware Sonic Interactions in AR
par: Schütz, Laura, et autres
Publié: (2025)
par: Schütz, Laura, et autres
Publié: (2025)
TrackOR: Towards Personalized Intelligent Operating Rooms Through Robust Tracking
par: Wang, Tony Danjun, et autres
Publié: (2025)
par: Wang, Tony Danjun, et autres
Publié: (2025)
Re-Nerfing: Improving Novel View Synthesis through Novel View Synthesis
par: Tristram, Felix, et autres
Publié: (2023)
par: Tristram, Felix, et autres
Publié: (2023)
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
par: Yuan, Kun, et autres
Publié: (2024)
par: Yuan, Kun, et autres
Publié: (2024)
From large language models to multimodal AI: A scoping review on the potential of generative AI in medicine
par: Buess, Lukas, et autres
Publié: (2025)
par: Buess, Lukas, et autres
Publié: (2025)
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
par: Yuan, Kun, et autres
Publié: (2024)
par: Yuan, Kun, et autres
Publié: (2024)
Recognizing Surgical Phases Anywhere: Few-Shot Test-time Adaptation and Task-graph Guided Refinement
par: Yuan, Kun, et autres
Publié: (2025)
par: Yuan, Kun, et autres
Publié: (2025)
Object Pose Transformer: Unifying Unseen Object Pose Estimation
par: Li, Weihang, et autres
Publié: (2026)
par: Li, Weihang, et autres
Publié: (2026)
SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
par: Huang, Yiming, et autres
Publié: (2025)
par: Huang, Yiming, et autres
Publié: (2025)
SURGIVID: Annotation-Efficient Surgical Video Object Discovery
par: Köksal, Çağhan, et autres
Publié: (2024)
par: Köksal, Çağhan, et autres
Publié: (2024)
TopoOR: A Unified Topological Scene Representation for the Operating Room
par: Wang, Tony Danjun, et autres
Publié: (2026)
par: Wang, Tony Danjun, et autres
Publié: (2026)
HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation
par: Biagini, Diego, et autres
Publié: (2025)
par: Biagini, Diego, et autres
Publié: (2025)
Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis
par: Chen, Tingxuan, et autres
Publié: (2025)
par: Chen, Tingxuan, et autres
Publié: (2025)
ProtoFlow: Interpretable and Robust Surgical Workflow Modeling with Learned Dynamic Scene Graph Prototypes
par: Holm, Felix, et autres
Publié: (2025)
par: Holm, Felix, et autres
Publié: (2025)
CAT-SG: A Large Dynamic Scene Graph Dataset for Fine-Grained Understanding of Cataract Surgery
par: Holm, Felix, et autres
Publié: (2025)
par: Holm, Felix, et autres
Publié: (2025)
Neural Semantic Map-Learning for Autonomous Vehicles
par: Herb, Markus, et autres
Publié: (2024)
par: Herb, Markus, et autres
Publié: (2024)
XYZ-IBD: A High-precision Bin-picking Dataset for Object 6D Pose Estimation Capturing Real-world Industrial Complexity
par: Huang, Junwen, et autres
Publié: (2025)
par: Huang, Junwen, et autres
Publié: (2025)
Documents similaires
-
Specialized Foundation Models for Intelligent Operating Rooms
par: Özsoy, Ege, et autres
Publié: (2025) -
EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding
par: Özsoy, Ege, et autres
Publié: (2025) -
Language Agents for Hypothesis-driven Clinical Decision Making with Reinforcement Learning
par: Bani-Harouni, David, et autres
Publié: (2025) -
EHR2Path: Scalable Modeling of Longitudinal Patient Pathways from Multimodal Electronic Health Records
par: Pellegrini, Chantal, et autres
Publié: (2025) -
RaDialog: A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance
par: Pellegrini, Chantal, et autres
Publié: (2023)