TemporalDoRA: Temporal PEFT for Robust Surgical Video Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Carlini, Luca, Lena, Chiara, Hassan, Cesare, Stoyanov, Danail, De Momi, Elena, Bano, Sophia, Hoque, Mobarak I. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA
di: Carlini, Luca, et al.
Pubblicazione: (2025)
di: Carlini, Luca, et al.
Pubblicazione: (2025)
SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention
di: Dhake, Shreyas C., et al.
Pubblicazione: (2025)
di: Dhake, Shreyas C., et al.
Pubblicazione: (2025)
DARES: Depth Anything in Robotic Endoscopic Surgery with Self-supervised Vector-LoRA of the Foundation Model
di: Zeinoddin, Mona Sheikh, et al.
Pubblicazione: (2024)
di: Zeinoddin, Mona Sheikh, et al.
Pubblicazione: (2024)
Training-free Temporal Object Tracking in Surgical Videos
di: Koley, Subhadeep, et al.
Pubblicazione: (2026)
di: Koley, Subhadeep, et al.
Pubblicazione: (2026)
Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision
di: Ju, Xinwei, et al.
Pubblicazione: (2026)
di: Ju, Xinwei, et al.
Pubblicazione: (2026)
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
di: He, Runlong, et al.
Pubblicazione: (2024)
di: He, Runlong, et al.
Pubblicazione: (2024)
Surgical AI Copilot: Energy-Based Fourier Gradient Low-Rank Adaptation for Surgical LLM Agent Reasoning and Planning
di: Huang, Jiayuan, et al.
Pubblicazione: (2025)
di: Huang, Jiayuan, et al.
Pubblicazione: (2025)
Mismatched: Evaluating the Limits of Image Matching Approaches and Benchmarks
di: Bonilla, Sierra, et al.
Pubblicazione: (2024)
di: Bonilla, Sierra, et al.
Pubblicazione: (2024)
Gaussian Pancakes: Geometrically-Regularized 3D Gaussian Splatting for Realistic Endoscopic Reconstruction
di: Bonilla, Sierra, et al.
Pubblicazione: (2024)
di: Bonilla, Sierra, et al.
Pubblicazione: (2024)
Temporal Cluster Assignment for Efficient Real-Time Video Segmentation
di: Yung, Ka-Wai, et al.
Pubblicazione: (2025)
di: Yung, Ka-Wai, et al.
Pubblicazione: (2025)
Endo-FASt3r: Endoscopic Foundation model Adaptation for Structure from motion
di: Zeinoddin, Mona Sheikh, et al.
Pubblicazione: (2025)
di: Zeinoddin, Mona Sheikh, et al.
Pubblicazione: (2025)
Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos
di: Shao, Zhimin, et al.
Pubblicazione: (2024)
di: Shao, Zhimin, et al.
Pubblicazione: (2024)
MambaNetLK: Enhancing Colonoscopy Point Cloud Registration with Mamba
di: Jiang, Linzhe, et al.
Pubblicazione: (2025)
di: Jiang, Linzhe, et al.
Pubblicazione: (2025)
Implementation and Assessment of an Augmented Training Curriculum for Surgical Robotics
di: Rota, Alberto, et al.
Pubblicazione: (2025)
di: Rota, Alberto, et al.
Pubblicazione: (2025)
RRT-GPMP2: A Motion Planner for Mobile Robots in Complex Maze Environments
di: Meng, Jiawei, et al.
Pubblicazione: (2024)
di: Meng, Jiawei, et al.
Pubblicazione: (2024)
Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting
di: Song, Tianyi, et al.
Pubblicazione: (2026)
di: Song, Tianyi, et al.
Pubblicazione: (2026)
HyKey: Hyperspectral Keypoint Detection and Matching in Minimally Invasive Surgery
di: Saikia, Alexander, et al.
Pubblicazione: (2026)
di: Saikia, Alexander, et al.
Pubblicazione: (2026)
Robotic Arm Platform for Multi-View Image Acquisition and 3D Reconstruction in Minimally Invasive Surgery
di: Saikia, Alexander, et al.
Pubblicazione: (2024)
di: Saikia, Alexander, et al.
Pubblicazione: (2024)
Graph Neural Networks for Surgical Scene Segmentation
di: Li, Yihan, et al.
Pubblicazione: (2025)
di: Li, Yihan, et al.
Pubblicazione: (2025)
SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy
di: Li, Shi, et al.
Pubblicazione: (2026)
di: Li, Shi, et al.
Pubblicazione: (2026)
Towards Designing a Question-Answering Chatbot for Online News: Understanding Questions and Perspectives
di: Hoque, Md Naimul, et al.
Pubblicazione: (2023)
di: Hoque, Md Naimul, et al.
Pubblicazione: (2023)
RealSynCol: a high-fidelity synthetic colon dataset for 3D reconstruction applications
di: Lena, Chiara, et al.
Pubblicazione: (2026)
di: Lena, Chiara, et al.
Pubblicazione: (2026)
SEDMamba: Enhancing Selective State Space Modelling with Bottleneck Mechanism and Fine-to-Coarse Temporal Fusion for Efficient Error Detection in Robot-Assisted Surgery
di: Xu, Jialang, et al.
Pubblicazione: (2024)
di: Xu, Jialang, et al.
Pubblicazione: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
di: Wang, Yueqian, et al.
Pubblicazione: (2024)
Continual Learning for Temporal-Sensitive Question Answering
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
Question Calibration and Multi-Hop Modeling for Temporal Question Answering
di: Xue, Chao, et al.
Pubblicazione: (2024)
di: Xue, Chao, et al.
Pubblicazione: (2024)
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
di: He, Runlong, et al.
Pubblicazione: (2025)
di: He, Runlong, et al.
Pubblicazione: (2025)
A multi-centre, multi-device benchmark dataset for landmark-based comprehensive fetal biometry
di: Di Vece, Chiara, et al.
Pubblicazione: (2025)
di: Di Vece, Chiara, et al.
Pubblicazione: (2025)
Dynamic Obstacle Avoidance of Unmanned Surface Vehicles in Maritime Environments Using Gaussian Processes Based Motion Planning
di: Meng, Jiawei, et al.
Pubblicazione: (2024)
di: Meng, Jiawei, et al.
Pubblicazione: (2024)
SHADeS: Self-supervised Monocular Depth Estimation Through Non-Lambertian Image Decomposition
di: Daher, Rema, et al.
Pubblicazione: (2025)
di: Daher, Rema, et al.
Pubblicazione: (2025)
SurgicalGS: Dynamic 3D Gaussian Splatting for Accurate Robotic-Assisted Surgical Scene Reconstruction
di: Chen, Jialei, et al.
Pubblicazione: (2024)
di: Chen, Jialei, et al.
Pubblicazione: (2024)
Self-Supervised Contrastive Embedding Adaptation for Endoscopic Image Matching
di: Rota, Alberto, et al.
Pubblicazione: (2025)
di: Rota, Alberto, et al.
Pubblicazione: (2025)
It's High Time: A Survey of Temporal Question Answering
di: Piryani, Bhawna, et al.
Pubblicazione: (2025)
di: Piryani, Bhawna, et al.
Pubblicazione: (2025)
Temporal Knowledge Graph Question Answering: A Survey
di: Su, Miao, et al.
Pubblicazione: (2024)
di: Su, Miao, et al.
Pubblicazione: (2024)
Question Answering Over Spatio-Temporal Knowledge Graph
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
di: Dai, Xinbang, et al.
Pubblicazione: (2024)
Faithful Temporal Question Answering over Heterogeneous Sources
di: Jia, Zhen, et al.
Pubblicazione: (2024)
di: Jia, Zhen, et al.
Pubblicazione: (2024)
Temporal-Aware Heterogeneous Graph Reasoning with Multi-View Fusion for Temporal Question Answering
di: Wen, Wuzhenghong, et al.
Pubblicazione: (2026)
di: Wen, Wuzhenghong, et al.
Pubblicazione: (2026)
LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering
di: Dong, Xinxin, et al.
Pubblicazione: (2025)
di: Dong, Xinxin, et al.
Pubblicazione: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
di: Liang, Lili, et al.
Pubblicazione: (2024)
di: Liang, Lili, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025) -
When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA
di: Carlini, Luca, et al.
Pubblicazione: (2025) -
SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention
di: Dhake, Shreyas C., et al.
Pubblicazione: (2025) -
DARES: Depth Anything in Robotic Endoscopic Surgery with Self-supervised Vector-LoRA of the Foundation Model
di: Zeinoddin, Mona Sheikh, et al.
Pubblicazione: (2024) -
Training-free Temporal Object Tracking in Surgical Videos
di: Koley, Subhadeep, et al.
Pubblicazione: (2026)