SurgLQA: Scalable Long-Horizon Surgical Video Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Diandian, Yang, Xikai, Li, Ruiyang, Pei, Jialun, Heng, Pheng-Ann |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Surgical Workflow Recognition and Blocking Effectiveness Detection in Laparoscopic Liver Resections with Pringle Maneuver
di: Guo, Diandian, et al.
Pubblicazione: (2024)
di: Guo, Diandian, et al.
Pubblicazione: (2024)
Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos
di: Pei, Jialun, et al.
Pubblicazione: (2025)
di: Pei, Jialun, et al.
Pubblicazione: (2025)
Benchmarking Endoscopic Surgical Image Restoration and Beyond
di: Pei, Jialun, et al.
Pubblicazione: (2025)
di: Pei, Jialun, et al.
Pubblicazione: (2025)
S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR
di: Pei, Jialun, et al.
Pubblicazione: (2024)
di: Pei, Jialun, et al.
Pubblicazione: (2024)
Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms
di: Guo, Diandian, et al.
Pubblicazione: (2024)
di: Guo, Diandian, et al.
Pubblicazione: (2024)
Attenuation-Resilient Alternating Optimization for Laparoscopic Liver Landmark Detection
di: Liu, Lanqing, et al.
Pubblicazione: (2026)
di: Liu, Lanqing, et al.
Pubblicazione: (2026)
MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization
di: Zhang, Yiyi, et al.
Pubblicazione: (2025)
di: Zhang, Yiyi, et al.
Pubblicazione: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2025)
di: Xu, Dunyuan, et al.
Pubblicazione: (2025)
SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy
di: Li, Shi, et al.
Pubblicazione: (2026)
di: Li, Shi, et al.
Pubblicazione: (2026)
Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
di: XU, Dunyuan, et al.
Pubblicazione: (2025)
di: XU, Dunyuan, et al.
Pubblicazione: (2025)
Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2026)
di: Xu, Dunyuan, et al.
Pubblicazione: (2026)
Depth-Driven Geometric Prompt Learning for Laparoscopic Liver Landmark Detection
di: Pei, Jialun, et al.
Pubblicazione: (2024)
di: Pei, Jialun, et al.
Pubblicazione: (2024)
Topology-Constrained Learning for Efficient Laparoscopic Liver Landmark Detection
di: Cui, Ruize, et al.
Pubblicazione: (2025)
di: Cui, Ruize, et al.
Pubblicazione: (2025)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
di: Zhang, Chengyi, et al.
Pubblicazione: (2026)
di: Zhang, Chengyi, et al.
Pubblicazione: (2026)
Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework
di: Zhu, Yu, et al.
Pubblicazione: (2026)
di: Zhu, Yu, et al.
Pubblicazione: (2026)
Landmark-Free Preoperative-to-Intraoperative Registration in Laparoscopic Liver Resection
di: Zhou, Jun, et al.
Pubblicazione: (2025)
di: Zhou, Jun, et al.
Pubblicazione: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
Multi-scale Spatio-temporal Transformer-based Imbalanced Longitudinal Learning for Glaucoma Forecasting from Irregular Time Series Images
di: Yang, Xikai, et al.
Pubblicazione: (2024)
di: Yang, Xikai, et al.
Pubblicazione: (2024)
CalibNet: Dual-branch Cross-modal Calibration for RGB-D Salient Instance Segmentation
di: Pei, Jialun, et al.
Pubblicazione: (2023)
di: Pei, Jialun, et al.
Pubblicazione: (2023)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)
di: Yang, Xikai, et al.
Pubblicazione: (2025)
Agentic Keyframe Search for Video Question Answering
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
Decoupling Feature Representations of Ego and Other Modalities for Incomplete Multi-modal Brain Tumor Segmentation
di: Yang, Kaixiang, et al.
Pubblicazione: (2024)
di: Yang, Kaixiang, et al.
Pubblicazione: (2024)
Preoperative-to-intraoperative Liver Registration for Laparoscopic Surgery via Latent-Grounded Correspondence Constraints
di: Cui, Ruize, et al.
Pubblicazione: (2026)
di: Cui, Ruize, et al.
Pubblicazione: (2026)
MS2Mesh-XR: Multi-modal Sketch-to-Mesh Generation in XR Environments
di: Tong, Yuqi, et al.
Pubblicazione: (2024)
di: Tong, Yuqi, et al.
Pubblicazione: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition
di: Yang, Shu, et al.
Pubblicazione: (2024)
di: Yang, Shu, et al.
Pubblicazione: (2024)
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
TemporalDoRA: Temporal PEFT for Robust Surgical Video Question Answering
di: Carlini, Luca, et al.
Pubblicazione: (2026)
di: Carlini, Luca, et al.
Pubblicazione: (2026)
HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation
di: Biagini, Diego, et al.
Pubblicazione: (2025)
di: Biagini, Diego, et al.
Pubblicazione: (2025)
SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary
di: He, Jingyi, et al.
Pubblicazione: (2026)
di: He, Jingyi, et al.
Pubblicazione: (2026)
SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos
di: Wu, Jinlin, et al.
Pubblicazione: (2026)
di: Wu, Jinlin, et al.
Pubblicazione: (2026)
SemiVT-Surge: Semi-Supervised Video Transformer for Surgical Phase Recognition
di: Li, Yiping, et al.
Pubblicazione: (2025)
di: Li, Yiping, et al.
Pubblicazione: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning
di: Li, Jiajie, et al.
Pubblicazione: (2024)
di: Li, Jiajie, et al.
Pubblicazione: (2024)
A Simple LLM Framework for Long-Range Video Question-Answering
di: Zhang, Ce, et al.
Pubblicazione: (2023)
di: Zhang, Ce, et al.
Pubblicazione: (2023)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
di: Fan, Sunqi, et al.
Pubblicazione: (2025)
Intuitive Surgical SurgToolLoc and SurgVU Challenges Results: 2022-2025
di: Zia, Aneeq, et al.
Pubblicazione: (2023)
di: Zia, Aneeq, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Surgical Workflow Recognition and Blocking Effectiveness Detection in Laparoscopic Liver Resections with Pringle Maneuver
di: Guo, Diandian, et al.
Pubblicazione: (2024) -
Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos
di: Pei, Jialun, et al.
Pubblicazione: (2025) -
Benchmarking Endoscopic Surgical Image Restoration and Beyond
di: Pei, Jialun, et al.
Pubblicazione: (2025) -
S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR
di: Pei, Jialun, et al.
Pubblicazione: (2024) -
Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms
di: Guo, Diandian, et al.
Pubblicazione: (2024)