Surgical Scene Understanding in the Era of Foundation AI Models: A Comprehensive Review
Fuente:
arXiv
Salvato in:
| Autori principali: | Khan, Ufaq, Nawaz, Umair, Qayyum, Adnan, Ashraf, Shazad, Xie, Yutong, Khan, Muhammad Haris, Bilal, Muhammad, Qadir, Junaid |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
di: Khan, Ufaq, et al.
Pubblicazione: (2026)
di: Khan, Ufaq, et al.
Pubblicazione: (2026)
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
di: Nawaz, Umair, et al.
Pubblicazione: (2025)
di: Nawaz, Umair, et al.
Pubblicazione: (2025)
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
di: Ding, Bonan, et al.
Pubblicazione: (2026)
di: Ding, Bonan, et al.
Pubblicazione: (2026)
AURORA: Adaptive Unified Representation for Robust Ultrasound Analysis
di: Khan, Ufaq, et al.
Pubblicazione: (2026)
di: Khan, Ufaq, et al.
Pubblicazione: (2026)
RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing
di: Abioye, Sofiat, et al.
Pubblicazione: (2026)
di: Abioye, Sofiat, et al.
Pubblicazione: (2026)
TEMSET-24K: Densely Annotated Dataset for Indexing Multipart Endoscopic Videos using Surgical Timeline Segmentation
di: Bilal, Muhammad, et al.
Pubblicazione: (2025)
di: Bilal, Muhammad, et al.
Pubblicazione: (2025)
Improving Pseudo-labelling and Enhancing Robustness for Semi-Supervised Domain Generalization
di: Khan, Adnan, et al.
Pubblicazione: (2024)
di: Khan, Adnan, et al.
Pubblicazione: (2024)
WorldCache: Content-Aware Caching for Accelerated Video World Models
di: Nawaz, Umair, et al.
Pubblicazione: (2026)
di: Nawaz, Umair, et al.
Pubblicazione: (2026)
Robust and Label-Efficient Deep Waste Detection
di: Abid, Hassan, et al.
Pubblicazione: (2025)
di: Abid, Hassan, et al.
Pubblicazione: (2025)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
CountZES: Counting via Zero-Shot Exemplar Selection
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2025)
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2025)
TerraFM: A Scalable Foundation Model for Unified Multisensor Earth Observation
di: Danish, Muhammad Sohail, et al.
Pubblicazione: (2025)
di: Danish, Muhammad Sohail, et al.
Pubblicazione: (2025)
Noise-Tolerant Few-Shot Unsupervised Adapter for Vision-Language Models
di: Ali, Eman, et al.
Pubblicazione: (2023)
di: Ali, Eman, et al.
Pubblicazione: (2023)
Agentic AI for Remote Sensing: Technical Challenges and Research Directions
di: Munir, Muhammad Akhtar, et al.
Pubblicazione: (2026)
di: Munir, Muhammad Akhtar, et al.
Pubblicazione: (2026)
Crowd Scene Analysis using Deep Learning Techniques
di: Asif, Muhammad Junaid
Pubblicazione: (2025)
di: Asif, Muhammad Junaid
Pubblicazione: (2025)
Divergent Domains, Convergent Grading: Enhancing Generalization in Diabetic Retinopathy Grading
di: Chokuwa, Sharon, et al.
Pubblicazione: (2024)
di: Chokuwa, Sharon, et al.
Pubblicazione: (2024)
From Individual Prompts to Collective Intelligence: Mainstreaming Generative AI in the Classroom
di: Qadir, Junaid, et al.
Pubblicazione: (2026)
di: Qadir, Junaid, et al.
Pubblicazione: (2026)
O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models
di: Sharifdeen, Ashshak, et al.
Pubblicazione: (2025)
di: Sharifdeen, Ashshak, et al.
Pubblicazione: (2025)
R-CONV: An Analytical Approach for Efficient Data Reconstruction via Convolutional Gradients
di: Eltaras, Tamer Ahmed, et al.
Pubblicazione: (2024)
di: Eltaras, Tamer Ahmed, et al.
Pubblicazione: (2024)
FrogDogNet: Fourier frequency Retained visual prompt Output Guidance for Domain Generalization of CLIP in Remote Sensing
di: Gunduboina, Hariseetharam, et al.
Pubblicazione: (2025)
di: Gunduboina, Hariseetharam, et al.
Pubblicazione: (2025)
DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models
di: Ali, Eman, et al.
Pubblicazione: (2024)
di: Ali, Eman, et al.
Pubblicazione: (2024)
PerSense: Training-Free Personalized Instance Segmentation in Dense Images
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2024)
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2024)
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
di: Alkaeed, Mahdi, et al.
Pubblicazione: (2026)
di: Alkaeed, Mahdi, et al.
Pubblicazione: (2026)
Enhanced Multimodal Content Moderation of Children's Videos using Audiovisual Fusion
di: Ahmed, Syed Hammad, et al.
Pubblicazione: (2024)
di: Ahmed, Syed Hammad, et al.
Pubblicazione: (2024)
NT-VOT211: A Large-Scale Benchmark for Night-time Visual Object Tracking
di: Liu, Yu, et al.
Pubblicazione: (2024)
di: Liu, Yu, et al.
Pubblicazione: (2024)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
Waste-Bench: A Comprehensive Benchmark for Evaluating VLLMs in Cluttered Environments
di: Ali, Muhammad, et al.
Pubblicazione: (2025)
di: Ali, Muhammad, et al.
Pubblicazione: (2025)
Depth Attention for Robust RGB Tracking
di: Liu, Yu, et al.
Pubblicazione: (2024)
di: Liu, Yu, et al.
Pubblicazione: (2024)
Chameleon: Images Are What You Need For Multimodal Learning Robust To Missing Modalities
di: Liaqat, Muhammad Irzam, et al.
Pubblicazione: (2024)
di: Liaqat, Muhammad Irzam, et al.
Pubblicazione: (2024)
Modality Invariant Multimodal Learning to Handle Missing Modalities: A Single-Branch Approach
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
Towards PerSense++: Advancing Training-Free Personalized Instance Segmentation in Dense Images
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2025)
di: Siddiqui, Muhammad Ibraheem, et al.
Pubblicazione: (2025)
ReConText3D: Replay-based Continual Text-to-3D Generation
di: Khan, Muhammad Ahmed Ullah, et al.
Pubblicazione: (2026)
di: Khan, Muhammad Ahmed Ullah, et al.
Pubblicazione: (2026)
VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping
di: Baliah, Sanoojan, et al.
Pubblicazione: (2026)
di: Baliah, Sanoojan, et al.
Pubblicazione: (2026)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
Judging from Support-set: A New Way to Utilize Few-Shot Segmentation for Segmentation Refinement Process
di: Moon, Seonghyeon, et al.
Pubblicazione: (2024)
di: Moon, Seonghyeon, et al.
Pubblicazione: (2024)
Pose-Guided Self-Training with Two-Stage Clustering for Unsupervised Landmark Discovery
di: Tourani, Siddharth, et al.
Pubblicazione: (2024)
di: Tourani, Siddharth, et al.
Pubblicazione: (2024)
Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision
di: Kuckreja, Kartik, et al.
Pubblicazione: (2026)
di: Kuckreja, Kartik, et al.
Pubblicazione: (2026)
Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score
di: Ali, Eman, et al.
Pubblicazione: (2025)
di: Ali, Eman, et al.
Pubblicazione: (2025)
Improving Single Domain-Generalized Object Detection: A Focus on Diversification and Alignment
di: Danish, Muhammad Sohail, et al.
Pubblicazione: (2024)
di: Danish, Muhammad Sohail, et al.
Pubblicazione: (2024)
Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2026)
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
di: Khan, Ufaq, et al.
Pubblicazione: (2026) -
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
di: Nawaz, Umair, et al.
Pubblicazione: (2025) -
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
di: Ding, Bonan, et al.
Pubblicazione: (2026) -
AURORA: Adaptive Unified Representation for Robust Ultrasound Analysis
di: Khan, Ufaq, et al.
Pubblicazione: (2026) -
RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing
di: Abioye, Sofiat, et al.
Pubblicazione: (2026)