Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
Fuente:
arXiv
Salvato in:
| Autori principali: | Che, Chengan, Wang, Chao, Huang, Jiayuan, Chen, Xinyue, Garcia-Peraza-Herrera, Luis C. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings
di: Che, Chengan, et al.
Pubblicazione: (2025)
di: Che, Chengan, et al.
Pubblicazione: (2025)
A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking
di: Che, Chengan, et al.
Pubblicazione: (2025)
di: Che, Chengan, et al.
Pubblicazione: (2025)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
Lightweight Model Pre-training via Language Guided Knowledge Distillation
di: Li, Mingsheng, et al.
Pubblicazione: (2024)
di: Li, Mingsheng, et al.
Pubblicazione: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Ye, Wei, et al.
Pubblicazione: (2024)
di: Ye, Wei, et al.
Pubblicazione: (2024)
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Empowering Functional Neuroimaging: A Pre-trained Generative Framework for Unified Representation of Neural Signals
di: Yao, Weiheng, et al.
Pubblicazione: (2025)
di: Yao, Weiheng, et al.
Pubblicazione: (2025)
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training
di: Han, John J., et al.
Pubblicazione: (2026)
di: Han, John J., et al.
Pubblicazione: (2026)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
A Reality Check of Vision-Language Pre-training in Radiology: Have We Progressed Using Text?
di: Silva-Rodríguez, Julio, et al.
Pubblicazione: (2025)
di: Silva-Rodríguez, Julio, et al.
Pubblicazione: (2025)
Traj-LLM: A New Exploration for Empowering Trajectory Prediction with Pre-trained Large Language Models
di: Lan, Zhengxing, et al.
Pubblicazione: (2024)
di: Lan, Zhengxing, et al.
Pubblicazione: (2024)
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
di: Chen, Xuezheng, et al.
Pubblicazione: (2025)
di: Chen, Xuezheng, et al.
Pubblicazione: (2025)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
di: Qiao, Yixuan, et al.
Pubblicazione: (2021)
di: Qiao, Yixuan, et al.
Pubblicazione: (2021)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
di: Zhou, Zijian, et al.
Pubblicazione: (2023)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
di: Zhou, Wenlve, et al.
Pubblicazione: (2024)
di: Zhou, Wenlve, et al.
Pubblicazione: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
di: Huang, Jiale, et al.
Pubblicazione: (2024)
di: Huang, Jiale, et al.
Pubblicazione: (2024)
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
di: Wu, Wei, et al.
Pubblicazione: (2024)
di: Wu, Wei, et al.
Pubblicazione: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
di: Chen, Wutao, et al.
Pubblicazione: (2026)
di: Chen, Wutao, et al.
Pubblicazione: (2026)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
Continual Forgetting for Pre-trained Vision Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
Let ViT Speak: Generative Language-Image Pre-training
di: Fang, Yan, et al.
Pubblicazione: (2026)
di: Fang, Yan, et al.
Pubblicazione: (2026)
Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer
di: Luo, Anwei, et al.
Pubblicazione: (2023)
di: Luo, Anwei, et al.
Pubblicazione: (2023)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
3D Scene Graph Guided Vision-Language Pre-training
di: Liu, Hao, et al.
Pubblicazione: (2024)
di: Liu, Hao, et al.
Pubblicazione: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations
di: Wang, Chao, et al.
Pubblicazione: (2025) -
LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings
di: Che, Chengan, et al.
Pubblicazione: (2025) -
A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking
di: Che, Chengan, et al.
Pubblicazione: (2025) -
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024) -
Lightweight Model Pre-training via Language Guided Knowledge Distillation
di: Li, Mingsheng, et al.
Pubblicazione: (2024)