MuST: Multi-Scale Transformers for Surgical Phase Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Pérez, Alejandra, Rodríguez, Santiago, Ayobi, Nicolás, Aparicio, Nicolás, Dessevres, Eugénie, Arbeláez, Pablo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Pixel-Wise Recognition for Holistic Surgical Scene Understanding
by: Ayobi, Nicolás, et al.
Published: (2024)
by: Ayobi, Nicolás, et al.
Published: (2024)
MATIS: Masked-Attention Transformers for Surgical Instrument Segmentation
by: Ayobi, Nicolás, et al.
Published: (2023)
by: Ayobi, Nicolás, et al.
Published: (2023)
Towards Holistic Surgical Scene Understanding
by: Valderrama, Natalia, et al.
Published: (2022)
by: Valderrama, Natalia, et al.
Published: (2022)
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
by: Yuan, Kun, et al.
Published: (2024)
by: Yuan, Kun, et al.
Published: (2024)
LoViT: Long Video Transformer for Surgical Phase Recognition
by: Liu, Yang, et al.
Published: (2023)
by: Liu, Yang, et al.
Published: (2023)
Adaptation of Multi-modal Representation Models for Multi-task Surgical Computer Vision
by: Walimbe, Soham, et al.
Published: (2025)
by: Walimbe, Soham, et al.
Published: (2025)
CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition
by: Stilz, Florian, et al.
Published: (2026)
by: Stilz, Florian, et al.
Published: (2026)
Stabilizing Temporal Inference Dynamics for Online Surgical Phase Recognition
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
Holistic Surgical Phase Recognition with Hierarchical Input Dependent State Space Models
by: Wu, Haoyang, et al.
Published: (2025)
by: Wu, Haoyang, et al.
Published: (2025)
CholecTrack20: A Multi-Perspective Tracking Dataset for Surgical Tools
by: Nwoye, Chinedu Innocent, et al.
Published: (2023)
by: Nwoye, Chinedu Innocent, et al.
Published: (2023)
Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures
by: Yuan, Kun, et al.
Published: (2023)
by: Yuan, Kun, et al.
Published: (2023)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
by: Baby, Britty, et al.
Published: (2025)
by: Baby, Britty, et al.
Published: (2025)
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
by: Yuan, Kun, et al.
Published: (2024)
by: Yuan, Kun, et al.
Published: (2024)
Advancing Surgical VQA with Scene Graph Knowledge
by: Yuan, Kun, et al.
Published: (2023)
by: Yuan, Kun, et al.
Published: (2023)
Surgical Triplet Recognition via Diffusion Model
by: Liu, Daochang, et al.
Published: (2024)
by: Liu, Daochang, et al.
Published: (2024)
Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis
by: Chen, Tingxuan, et al.
Published: (2025)
by: Chen, Tingxuan, et al.
Published: (2025)
EgoSurgery-Phase: A Dataset of Surgical Phase Recognition from Egocentric Open Surgery Videos
by: Fujii, Ryo, et al.
Published: (2024)
by: Fujii, Ryo, et al.
Published: (2024)
MoST: Motion Style Transformer between Diverse Action Contents
by: Kim, Boeun, et al.
Published: (2024)
by: Kim, Boeun, et al.
Published: (2024)
MuTri: Multi-view Tri-alignment for OCT to OCTA 3D Image Translation
by: Chen, Zhuangzhuang, et al.
Published: (2025)
by: Chen, Zhuangzhuang, et al.
Published: (2025)
SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning
by: Perez, Alejandra, et al.
Published: (2026)
by: Perez, Alejandra, et al.
Published: (2026)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
by: Wang, Guankun, et al.
Published: (2025)
by: Wang, Guankun, et al.
Published: (2025)
Deep Learning at the Intersection: Certified Robustness as a Tool for 3D Vision
by: S, Gabriel Pérez, et al.
Published: (2024)
by: S, Gabriel Pérez, et al.
Published: (2024)
DSTED: Decoupling Temporal Stabilization and Discriminative Enhancement for Surgical Workflow Recognition
by: Chen, Yueyao, et al.
Published: (2025)
by: Chen, Yueyao, et al.
Published: (2025)
MuDreamer: Learning Predictive World Models without Reconstruction
by: Burchi, Maxime, et al.
Published: (2024)
by: Burchi, Maxime, et al.
Published: (2024)
Towards Automated Petrography
by: Chacón, Isai Daniel, et al.
Published: (2025)
by: Chacón, Isai Daniel, et al.
Published: (2025)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
by: Wang, Ni, et al.
Published: (2024)
by: Wang, Ni, et al.
Published: (2024)
Visual WetlandBirds Dataset: Bird Species Identification and Behavior Recognition in Videos
by: Rodriguez-Juan, Javier, et al.
Published: (2025)
by: Rodriguez-Juan, Javier, et al.
Published: (2025)
Where It Moves, It Matters: Referring Surgical Instrument Segmentation via Motion
by: Wei, Meng, et al.
Published: (2026)
by: Wei, Meng, et al.
Published: (2026)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
by: Chen, Jian, et al.
Published: (2025)
by: Chen, Jian, et al.
Published: (2025)
ViSketch-GPT: Collaborative Multi-Scale Feature Extraction for Sketch Recognition and Generation
by: Federico, Giulio, et al.
Published: (2025)
by: Federico, Giulio, et al.
Published: (2025)
One-Shot Action Recognition via Multi-Scale Spatial-Temporal Skeleton Matching
by: Yang, Siyuan, et al.
Published: (2023)
by: Yang, Siyuan, et al.
Published: (2023)
Stitching Gaps: Fusing Situated Perceptual Knowledge with Vision Transformers for High-Level Image Classification
by: Pandiani, Delfina Sol Martinez, et al.
Published: (2024)
by: Pandiani, Delfina Sol Martinez, et al.
Published: (2024)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
by: Xiao, Junbin, et al.
Published: (2026)
by: Xiao, Junbin, et al.
Published: (2026)
Operational Change Detection for Geographical Information: Overview and Challenges
by: Gonthier, Nicolas
Published: (2025)
by: Gonthier, Nicolas
Published: (2025)
End to End AI System for Surgical Gesture Sequence Recognition and Clinical Outcome Prediction
by: Li, Xi, et al.
Published: (2025)
by: Li, Xi, et al.
Published: (2025)
SketchGraphNet: A Memory-Efficient Hybrid Graph Transformer for Large-Scale Sketch Corpora Recognition
by: Chen, Shilong, et al.
Published: (2026)
by: Chen, Shilong, et al.
Published: (2026)
Nested-TNT: Hierarchical Vision Transformers with Multi-Scale Feature Processing
by: Liu, Yuang, et al.
Published: (2024)
by: Liu, Yuang, et al.
Published: (2024)
Multi-Scale Correlation-Aware Transformer for Maritime Vessel Re-Identification
by: Liu, Yunhe
Published: (2025)
by: Liu, Yunhe
Published: (2025)
MuM: Multi-View Masked Image Modeling for 3D Vision
by: Nordström, David, et al.
Published: (2025)
by: Nordström, David, et al.
Published: (2025)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
by: Ben-Ami, Dan, et al.
Published: (2026)
by: Ben-Ami, Dan, et al.
Published: (2026)
Similar Items
-
Pixel-Wise Recognition for Holistic Surgical Scene Understanding
by: Ayobi, Nicolás, et al.
Published: (2024) -
MATIS: Masked-Attention Transformers for Surgical Instrument Segmentation
by: Ayobi, Nicolás, et al.
Published: (2023) -
Towards Holistic Surgical Scene Understanding
by: Valderrama, Natalia, et al.
Published: (2022) -
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
by: Yuan, Kun, et al.
Published: (2024) -
LoViT: Long Video Transformer for Surgical Phase Recognition
by: Liu, Yang, et al.
Published: (2023)