GeoLanG: Geometry-Aware Language-Guided Grasping with Unified RGB-D Multimodal Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Rui, Wang, Guankun, Bai, Long, Gao, Huxin, Lai, Jiewen, Ng, Chi Kit, Wang, Jiazheng, Zhang, Fan, Ren, Hongliang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Geo-RepNet: Geometry-Aware Representation Learning for Surgical Phase Recognition in Endoscopic Submucosal Dissection
par: Tang, Rui, et autres
Publié: (2025)
par: Tang, Rui, et autres
Publié: (2025)
Contact-Aided Navigation of Flexible Robotic Endoscope Using Deep Reinforcement Learning in Dynamic Stomach
par: Ng, Chi Kit, et autres
Publié: (2025)
par: Ng, Chi Kit, et autres
Publié: (2025)
EndoARSS: Adapting Spatially-Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery
par: Wang, Guankun, et autres
Publié: (2025)
par: Wang, Guankun, et autres
Publié: (2025)
EndoARSS: Adapting Spatially Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery
par: Guankun Wang, et autres
Publié: (2025)
par: Guankun Wang, et autres
Publié: (2025)
EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy
par: Ng, Chi Kit, et autres
Publié: (2025)
par: Ng, Chi Kit, et autres
Publié: (2025)
Adapting SAM for Surgical Instrument Tracking and Segmentation in Endoscopic Submucosal Dissection Videos
par: Yu, Jieming, et autres
Publié: (2024)
par: Yu, Jieming, et autres
Publié: (2024)
How can reasoning capability empower the AI copilot robot in endoscopic surgery
par: Wang, Guankun, et autres
Publié: (2026)
par: Wang, Guankun, et autres
Publié: (2026)
EndoDDC: Learning Sparse to Dense Reconstruction for Endoscopic Robotic Navigation via Diffusion Depth Completion
par: Lin, Yinheng, et autres
Publié: (2026)
par: Lin, Yinheng, et autres
Publié: (2026)
TMR-VLA:Vision-Language-Action Model for Magnetic Motion Control of Tri-leg Silicone-based Soft Robot
par: Tang, Ruijie, et autres
Publié: (2026)
par: Tang, Ruijie, et autres
Publié: (2026)
Leveling3D: Leveling Up 3D Reconstruction with Feed-Forward 3D Gaussian Splatting and Geometry-Aware Generation
par: Huang, Yiming, et autres
Publié: (2026)
par: Huang, Yiming, et autres
Publié: (2026)
OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery
par: Bai, Long, et autres
Publié: (2024)
par: Bai, Long, et autres
Publié: (2024)
Multimodal Graph Representation Learning for Robust Surgical Workflow Recognition with Adversarial Feature Disentanglement
par: Bai, Long, et autres
Publié: (2025)
par: Bai, Long, et autres
Publié: (2025)
CoPESD: A Multi-Level Surgical Motion Dataset for Training Large Vision-Language Models to Co-Pilot Endoscopic Submucosal Dissection
par: Wang, Guankun, et autres
Publié: (2024)
par: Wang, Guankun, et autres
Publié: (2024)
ETSM: Automating Dissection Trajectory Suggestion and Confidence Map-Based Safety Margin Prediction for Robot-assisted Endoscopic Submucosal Dissection
par: Xu, Mengya, et autres
Publié: (2024)
par: Xu, Mengya, et autres
Publié: (2024)
PDZSeg: Adapting the Foundation Model for Dissection Zone Segmentation with Visual Prompts in Robot-assisted Endoscopic Submucosal Dissection
par: Xu, Mengya, et autres
Publié: (2024)
par: Xu, Mengya, et autres
Publié: (2024)
EndoOOD: Uncertainty-aware Out-of-distribution Detection in Capsule Endoscopy Diagnosis
par: Tan, Qiaozhi, et autres
Publié: (2024)
par: Tan, Qiaozhi, et autres
Publié: (2024)
Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery
par: Bai, Long, et autres
Publié: (2024)
par: Bai, Long, et autres
Publié: (2024)
Automatic Virtual‐to‐real Calibration and Dynamic Registration of Deformable Tissue for Endoscopic Submucosal Dissection
par: Yupeng Wang, et autres
Publié: (2025)
par: Yupeng Wang, et autres
Publié: (2025)
Jacobian Exploratory Dual-Phase Reinforcement Learning for Dynamic Endoluminal Navigation of Deformable Continuum Robots
par: Tian, Yu, et autres
Publié: (2025)
par: Tian, Yu, et autres
Publié: (2025)
CapsDT: Diffusion-Transformer for Capsule Robot Manipulation
par: He, Xiting, et autres
Publié: (2025)
par: He, Xiting, et autres
Publié: (2025)
Unlocking Mixed Reality for Medical Education: A See-Through Perspective on Head Anatomy
par: Wei, Yuqing, et autres
Publié: (2025)
par: Wei, Yuqing, et autres
Publié: (2025)
LanG -- A Governance-Aware Agentic AI Platform for Unified Security Operations
par: Abdennebi, Anes, et autres
Publié: (2026)
par: Abdennebi, Anes, et autres
Publié: (2026)
Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery
par: Ma, Boyi, et autres
Publié: (2025)
par: Ma, Boyi, et autres
Publié: (2025)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
par: Wang, Guankun, et autres
Publié: (2025)
par: Wang, Guankun, et autres
Publié: (2025)
EndoGSim: Physics-Aware 4D Dynamic Endoscopic Scene Simulations via MLLM-Guided Gaussian Splatting
par: Liu, Changjing, et autres
Publié: (2026)
par: Liu, Changjing, et autres
Publié: (2026)
LighTDiff: Surgical Endoscopic Image Low-Light Enhancement with T-Diffusion
par: Chen, Tong, et autres
Publié: (2024)
par: Chen, Tong, et autres
Publié: (2024)
LanDA: Language-Guided Multi-Source Domain Adaptation
par: Wang, Zhenbin, et autres
Publié: (2024)
par: Wang, Zhenbin, et autres
Publié: (2024)
Three-dimensional Morphological Reconstruction of Millimeter-Scale Soft Continuum Robots based on Dual-Stereo-Vision
par: Ren, Tian-Ao, et autres
Publié: (2024)
par: Ren, Tian-Ao, et autres
Publié: (2024)
Consensus-Driven Uncertainty for Robotic Grasping based on RGB Perception
par: Joyce, Eric C., et autres
Publié: (2025)
par: Joyce, Eric C., et autres
Publié: (2025)
Lan-grasp: Using Large Language Models for Semantic Object Grasping and Placement
par: Mirjalili, Reihaneh, et autres
Publié: (2023)
par: Mirjalili, Reihaneh, et autres
Publié: (2023)
Triplane Grasping: Efficient 6-DoF Grasping with Single RGB Images
par: Li, Yiming, et autres
Publié: (2024)
par: Li, Yiming, et autres
Publié: (2024)
SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
par: Huang, Yiming, et autres
Publié: (2025)
par: Huang, Yiming, et autres
Publié: (2025)
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
par: Wang, Guankun, et autres
Publié: (2024)
par: Wang, Guankun, et autres
Publié: (2024)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
par: Chen, Tong, et autres
Publié: (2024)
par: Chen, Tong, et autres
Publié: (2024)
GAPG: Geometry Aware Push-Grasping Synergy for Goal-Oriented Manipulation in Clutter
par: Xiao, Lijingze, et autres
Publié: (2026)
par: Xiao, Lijingze, et autres
Publié: (2026)
Multi-GraspLLM: A Multimodal LLM for Multi-Hand Semantic Guided Grasp Generation
par: Li, Haosheng, et autres
Publié: (2024)
par: Li, Haosheng, et autres
Publié: (2024)
MuLan: Multimodal-LLM Agent for Progressive and Interactive Multi-Object Diffusion
par: Li, Sen, et autres
Publié: (2024)
par: Li, Sen, et autres
Publié: (2024)
MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations
par: Wang, Kangxu, et autres
Publié: (2026)
par: Wang, Kangxu, et autres
Publié: (2026)
MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost
par: Xing, Sen, et autres
Publié: (2024)
par: Xing, Sen, et autres
Publié: (2024)
EndoDAC: Efficient Adapting Foundation Model for Self-Supervised Depth Estimation from Any Endoscopic Camera
par: Cui, Beilei, et autres
Publié: (2024)
par: Cui, Beilei, et autres
Publié: (2024)
Documents similaires
-
Geo-RepNet: Geometry-Aware Representation Learning for Surgical Phase Recognition in Endoscopic Submucosal Dissection
par: Tang, Rui, et autres
Publié: (2025) -
Contact-Aided Navigation of Flexible Robotic Endoscope Using Deep Reinforcement Learning in Dynamic Stomach
par: Ng, Chi Kit, et autres
Publié: (2025) -
EndoARSS: Adapting Spatially-Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery
par: Wang, Guankun, et autres
Publié: (2025) -
EndoARSS: Adapting Spatially Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery
par: Guankun Wang, et autres
Publié: (2025) -
EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy
par: Ng, Chi Kit, et autres
Publié: (2025)