SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
Fuente:
arXiv
Guardado en:
| Autores principales: | Shin, Jongmin, Kim, Ka Young, Cho, Eunki, Kim, Seong Tae, Oh, Namkee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Holistic Surgical Scene Graph
por: Shin, Jongmin, et al.
Publicado: (2025)
por: Shin, Jongmin, et al.
Publicado: (2025)
SurgX: Neuron-Concept Association for Explainable Surgical Phase Recognition
por: Kim, Ka Young, et al.
Publicado: (2025)
por: Kim, Ka Young, et al.
Publicado: (2025)
CurConMix+: A Unified Spatio-Temporal Framework for Hierarchical Surgical Workflow Understanding
por: Jeon, Yongjun, et al.
Publicado: (2026)
por: Jeon, Yongjun, et al.
Publicado: (2026)
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
por: Kim, Eunki, et al.
Publicado: (2025)
por: Kim, Eunki, et al.
Publicado: (2025)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
por: Choi, Tae-Min, et al.
Publicado: (2025)
por: Choi, Tae-Min, et al.
Publicado: (2025)
A generalizable foundation model for intraoperative understanding across surgical procedures
por: Park, Kanggil, et al.
Publicado: (2026)
por: Park, Kanggil, et al.
Publicado: (2026)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
por: An, Na Min, et al.
Publicado: (2025)
por: An, Na Min, et al.
Publicado: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
por: Drago, Mauro Orazio, et al.
Publicado: (2025)
por: Drago, Mauro Orazio, et al.
Publicado: (2025)
Learning Object-Centric Representations in SAR Images with Multi-Level Feature Fusion
por: Jang, Oh-Tae, et al.
Publicado: (2025)
por: Jang, Oh-Tae, et al.
Publicado: (2025)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
por: Zhang, Chengyi, et al.
Publicado: (2026)
por: Zhang, Chengyi, et al.
Publicado: (2026)
MonoWAD: Weather-Adaptive Diffusion Model for Robust Monocular 3D Object Detection
por: Oh, Youngmin, et al.
Publicado: (2024)
por: Oh, Youngmin, et al.
Publicado: (2024)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Balancing Efficiency and Quality: MoEISR for Arbitrary-Scale Image Super-Resolution
por: Oh, Young Jae, et al.
Publicado: (2023)
por: Oh, Young Jae, et al.
Publicado: (2023)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
por: Cho, Yeongjae, et al.
Publicado: (2024)
por: Cho, Yeongjae, et al.
Publicado: (2024)
SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention
por: Dhake, Shreyas C., et al.
Publicado: (2025)
por: Dhake, Shreyas C., et al.
Publicado: (2025)
Intuitive Surgical SurgToolLoc and SurgVU Challenges Results: 2022-2025
por: Zia, Aneeq, et al.
Publicado: (2023)
por: Zia, Aneeq, et al.
Publicado: (2023)
HDR-NSFF: High Dynamic Range Neural Scene Flow Fields
por: Dong-Yeon, Shin, et al.
Publicado: (2026)
por: Dong-Yeon, Shin, et al.
Publicado: (2026)
Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
por: Kim, Minkuk, et al.
Publicado: (2024)
por: Kim, Minkuk, et al.
Publicado: (2024)
AURA: Development and Validation of an Augmented Unplanned Removal Alert System using Synthetic ICU Videos
por: Seo, Junhyuk, et al.
Publicado: (2025)
por: Seo, Junhyuk, et al.
Publicado: (2025)
Seam360GS: Seamless 360° Gaussian Splatting from Real-World Omnidirectional Images
por: Shin, Changha, et al.
Publicado: (2025)
por: Shin, Changha, et al.
Publicado: (2025)
SurgRIPE challenge: Benchmark of Surgical Robot Instrument Pose Estimation
por: Xu, Haozheng, et al.
Publicado: (2025)
por: Xu, Haozheng, et al.
Publicado: (2025)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
por: Kim, Yoonshik, et al.
Publicado: (2025)
por: Kim, Yoonshik, et al.
Publicado: (2025)
Resource-Efficient Medical Report Generation using Large Language Models
por: Abdullah, et al.
Publicado: (2024)
por: Abdullah, et al.
Publicado: (2024)
SurgLaVi: Large-Scale Hierarchical Dataset for Surgical Vision-Language Representation Learning
por: Perez, Alejandra, et al.
Publicado: (2025)
por: Perez, Alejandra, et al.
Publicado: (2025)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
por: Kim, Yoonsik, et al.
Publicado: (2024)
por: Kim, Yoonsik, et al.
Publicado: (2024)
ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation
por: Kim, Shin Seong, et al.
Publicado: (2025)
por: Kim, Shin Seong, et al.
Publicado: (2025)
Factorized Multi-Resolution HashGrid for Efficient Neural Radiance Fields: Execution on Edge-Devices
por: Jun-Seong, Kim, et al.
Publicado: (2026)
por: Jun-Seong, Kim, et al.
Publicado: (2026)
Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models
por: You, Weiqiu, et al.
Publicado: (2026)
por: You, Weiqiu, et al.
Publicado: (2026)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
por: Lim, Su Hyeon, et al.
Publicado: (2024)
por: Lim, Su Hyeon, et al.
Publicado: (2024)
UCMNet: Uncertainty-Aware Context Memory Network for Under-Display Camera Image Restoration
por: Kim, Daehyun, et al.
Publicado: (2026)
por: Kim, Daehyun, et al.
Publicado: (2026)
IRASNet: Improved Feature-Level Clutter Reduction for Domain Generalized SAR-ATR
por: Jang, Oh-Tae, et al.
Publicado: (2024)
por: Jang, Oh-Tae, et al.
Publicado: (2024)
Noise Map Guidance: Inversion with Spatial Context for Real Image Editing
por: Cho, Hansam, et al.
Publicado: (2024)
por: Cho, Hansam, et al.
Publicado: (2024)
Robust 3D Shape Reconstruction in Zero-Shot from a Single Image in the Wild
por: Cho, Junhyeong, et al.
Publicado: (2024)
por: Cho, Junhyeong, et al.
Publicado: (2024)
SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition
por: Yang, Shu, et al.
Publicado: (2024)
por: Yang, Shu, et al.
Publicado: (2024)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
por: Kim, Jinyeong, et al.
Publicado: (2025)
por: Kim, Jinyeong, et al.
Publicado: (2025)
SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
por: Zeng, Zhitao, et al.
Publicado: (2025)
por: Zeng, Zhitao, et al.
Publicado: (2025)
SurgXBench: Explainable Vision-Language Model Benchmark for Surgery
por: Cheng, Jiajun, et al.
Publicado: (2025)
por: Cheng, Jiajun, et al.
Publicado: (2025)
Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
por: Jun-Seong, Kim, et al.
Publicado: (2025)
por: Jun-Seong, Kim, et al.
Publicado: (2025)
VLEER: Vision and Language Embeddings for Explainable Whole Slide Image Representation
por: Nguyen, Anh Tien, et al.
Publicado: (2025)
por: Nguyen, Anh Tien, et al.
Publicado: (2025)
Bridging Vision and Language for Robust Context-Aware Surgical Point Tracking: The VL-SurgPT Dataset and Benchmark
por: Zhou, Rulin, et al.
Publicado: (2025)
por: Zhou, Rulin, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Holistic Surgical Scene Graph
por: Shin, Jongmin, et al.
Publicado: (2025) -
SurgX: Neuron-Concept Association for Explainable Surgical Phase Recognition
por: Kim, Ka Young, et al.
Publicado: (2025) -
CurConMix+: A Unified Spatio-Temporal Framework for Hierarchical Surgical Workflow Understanding
por: Jeon, Yongjun, et al.
Publicado: (2026) -
Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?
por: Kim, Eunki, et al.
Publicado: (2025) -
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
por: Choi, Tae-Min, et al.
Publicado: (2025)