VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ziyang, Yu, Yang, Yang, Xulei, Yeo, Si Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
par: Zhang, Ziyang, et autres
Publié: (2025)
par: Zhang, Ziyang, et autres
Publié: (2025)
Future-Aware Interaction Network For Motion Forecasting
par: Li, Shijie, et autres
Publié: (2025)
par: Li, Shijie, et autres
Publié: (2025)
RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation
par: Chen, Yucheng, et autres
Publié: (2026)
par: Chen, Yucheng, et autres
Publié: (2026)
MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
par: Wang, Qirui, et autres
Publié: (2025)
par: Wang, Qirui, et autres
Publié: (2025)
Pre-training Everywhere: Parameter-Efficient Fine-Tuning for Medical Image Analysis via Target Parameter Pre-training
par: Lei, Xingliang, et autres
Publié: (2024)
par: Lei, Xingliang, et autres
Publié: (2024)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
par: Guo, Yangyang, et autres
Publié: (2023)
par: Guo, Yangyang, et autres
Publié: (2023)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
par: Zhang, Siyu, et autres
Publié: (2023)
par: Zhang, Siyu, et autres
Publié: (2023)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics
par: Mahdizadeh, Ailar, et autres
Publié: (2025)
par: Mahdizadeh, Ailar, et autres
Publié: (2025)
Efficient Vision-Language Pre-training by Cluster Masking
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
MedFILIP: Medical Fine-grained Language-Image Pre-training
par: Liang, Xinjie, et autres
Publié: (2025)
par: Liang, Xinjie, et autres
Publié: (2025)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
par: Zhou, Hantao, et autres
Publié: (2024)
par: Zhou, Hantao, et autres
Publié: (2024)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
par: Liu, Jiarun, et autres
Publié: (2024)
par: Liu, Jiarun, et autres
Publié: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
par: Tao, Yiyi, et autres
Publié: (2024)
par: Tao, Yiyi, et autres
Publié: (2024)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
par: Deng, Ziye, et autres
Publié: (2025)
par: Deng, Ziye, et autres
Publié: (2025)
Volumetric Environment Representation for Vision-Language Navigation
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
par: Tian, Yuxin, et autres
Publié: (2024)
par: Tian, Yuxin, et autres
Publié: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Ye, Wei, et autres
Publié: (2024)
par: Ye, Wei, et autres
Publié: (2024)
An Efficient 3D Convolutional Neural Network with Channel-wise, Spatial-grouped, and Temporal Convolutions
par: Wang, Zhe, et autres
Publié: (2025)
par: Wang, Zhe, et autres
Publié: (2025)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
par: Shi, Jiang-Xin, et autres
Publié: (2024)
par: Shi, Jiang-Xin, et autres
Publié: (2024)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
par: Dong, Wei, et autres
Publié: (2024)
par: Dong, Wei, et autres
Publié: (2024)
MedCutMix: A Data-Centric Approach to Improve Radiology Vision-Language Pre-training with Disease Awareness
par: Wang, Sinuo, et autres
Publié: (2025)
par: Wang, Sinuo, et autres
Publié: (2025)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)
par: Wu, Shihan, et autres
Publié: (2024)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
par: Yan, Xin, et autres
Publié: (2023)
par: Yan, Xin, et autres
Publié: (2023)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
par: Huang, Jiale, et autres
Publié: (2024)
par: Huang, Jiale, et autres
Publié: (2024)
Unsupervised Network for Single Image Raindrop Removal
par: Wang, Huijiao, et autres
Publié: (2024)
par: Wang, Huijiao, et autres
Publié: (2024)
Med-Tuning: A New Parameter-Efficient Tuning Framework for Medical Volumetric Segmentation
par: Shen, Jiachen, et autres
Publié: (2023)
par: Shen, Jiachen, et autres
Publié: (2023)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities
par: Yao, Yuang, et autres
Publié: (2025)
par: Yao, Yuang, et autres
Publié: (2025)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
par: Ding, Yuhe, et autres
Publié: (2024)
par: Ding, Yuhe, et autres
Publié: (2024)
AMF-MedIT: An Efficient Align-Modulation-Fusion Framework for Medical Image-Tabular Data
par: Yu, Congjing, et autres
Publié: (2025)
par: Yu, Congjing, et autres
Publié: (2025)
SAM-Med3D: Towards General-purpose Segmentation Models for Volumetric Medical Images
par: Wang, Haoyu, et autres
Publié: (2023)
par: Wang, Haoyu, et autres
Publié: (2023)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Multi-level Asymmetric Contrastive Learning for Volumetric Medical Image Segmentation Pre-training
par: Zeng, Shuang, et autres
Publié: (2023)
par: Zeng, Shuang, et autres
Publié: (2023)
Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding
par: Shui, Zhongyi, et autres
Publié: (2025)
par: Shui, Zhongyi, et autres
Publié: (2025)
PLIP: Language-Image Pre-training for Person Representation Learning
par: Zuo, Jialong, et autres
Publié: (2023)
par: Zuo, Jialong, et autres
Publié: (2023)
Unified Medical Image Pre-training in Language-Guided Common Semantic Space
par: He, Xiaoxuan, et autres
Publié: (2023)
par: He, Xiaoxuan, et autres
Publié: (2023)
Documents similaires
-
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
par: Zhang, Ziyang, et autres
Publié: (2025) -
Future-Aware Interaction Network For Motion Forecasting
par: Li, Shijie, et autres
Publié: (2025) -
RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation
par: Chen, Yucheng, et autres
Publié: (2026) -
MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
par: Wang, Qirui, et autres
Publié: (2025) -
Pre-training Everywhere: Parameter-Efficient Fine-Tuning for Medical Image Analysis via Target Parameter Pre-training
par: Lei, Xingliang, et autres
Publié: (2024)