MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Ziyang, Yu, Yang, Chen, Yucheng, Yang, Xulei, Yeo, Si Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation
di: Chen, Yucheng, et al.
Pubblicazione: (2026)
di: Chen, Yucheng, et al.
Pubblicazione: (2026)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
di: Kim, Minsu, et al.
Pubblicazione: (2024)
di: Kim, Minsu, et al.
Pubblicazione: (2024)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
Future-Aware Interaction Network For Motion Forecasting
di: Li, Shijie, et al.
Pubblicazione: (2025)
di: Li, Shijie, et al.
Pubblicazione: (2025)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
di: Wan, Zhongwei, et al.
Pubblicazione: (2023)
di: Wan, Zhongwei, et al.
Pubblicazione: (2023)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
di: Liu, Jiarun, et al.
Pubblicazione: (2024)
di: Liu, Jiarun, et al.
Pubblicazione: (2024)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2023)
di: Jin, Yang, et al.
Pubblicazione: (2023)
Zero-Shot 3D Visual Grounding from Vision-Language Models
di: Li, Rong, et al.
Pubblicazione: (2025)
di: Li, Rong, et al.
Pubblicazione: (2025)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
Anatomical Structure-Guided Medical Vision-Language Pre-training
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
MedCutMix: A Data-Centric Approach to Improve Radiology Vision-Language Pre-training with Disease Awareness
di: Wang, Sinuo, et al.
Pubblicazione: (2025)
di: Wang, Sinuo, et al.
Pubblicazione: (2025)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
di: Zhu, Lei, et al.
Pubblicazione: (2025)
di: Zhu, Lei, et al.
Pubblicazione: (2025)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
di: Ding, Yuhe, et al.
Pubblicazione: (2024)
di: Ding, Yuhe, et al.
Pubblicazione: (2024)
Unified Medical Image Pre-training in Language-Guided Common Semantic Space
di: He, Xiaoxuan, et al.
Pubblicazione: (2023)
di: He, Xiaoxuan, et al.
Pubblicazione: (2023)
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
di: Liu, Che, et al.
Pubblicazione: (2023)
di: Liu, Che, et al.
Pubblicazione: (2023)
MedFILIP: Medical Fine-grained Language-Image Pre-training
di: Liang, Xinjie, et al.
Pubblicazione: (2025)
di: Liang, Xinjie, et al.
Pubblicazione: (2025)
ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
di: Wang, Rongsheng, et al.
Pubblicazione: (2023)
di: Wang, Rongsheng, et al.
Pubblicazione: (2023)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
di: Deng, Ziye, et al.
Pubblicazione: (2025)
di: Deng, Ziye, et al.
Pubblicazione: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
di: Deng, Qiao, et al.
Pubblicazione: (2024)
di: Deng, Qiao, et al.
Pubblicazione: (2024)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
di: Mao, Jiawei, et al.
Pubblicazione: (2025)
di: Mao, Jiawei, et al.
Pubblicazione: (2025)
MultiMedVision: Multi-Modal Medical Vision Framework
di: Li, Frank, et al.
Pubblicazione: (2026)
di: Li, Frank, et al.
Pubblicazione: (2026)
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
di: Lai, Yuxiang, et al.
Pubblicazione: (2025)
di: Lai, Yuxiang, et al.
Pubblicazione: (2025)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
di: Han, Jiaming, et al.
Pubblicazione: (2025)
di: Han, Jiaming, et al.
Pubblicazione: (2025)
MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder
di: Li, Lei, et al.
Pubblicazione: (2024)
di: Li, Lei, et al.
Pubblicazione: (2024)
MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling
di: Liu, Jiyao, et al.
Pubblicazione: (2026)
di: Liu, Jiyao, et al.
Pubblicazione: (2026)
Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
di: Mahdavi, Zahra, et al.
Pubblicazione: (2025)
di: Mahdavi, Zahra, et al.
Pubblicazione: (2025)
Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
di: Su, Yongyi, et al.
Pubblicazione: (2025)
di: Su, Yongyi, et al.
Pubblicazione: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
di: Zang, Yuan, et al.
Pubblicazione: (2024)
di: Zang, Yuan, et al.
Pubblicazione: (2024)
MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
di: Wang, Qirui, et al.
Pubblicazione: (2025)
di: Wang, Qirui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
di: Zhang, Ziyang, et al.
Pubblicazione: (2025) -
RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation
di: Chen, Yucheng, et al.
Pubblicazione: (2026) -
Superpixel Semantics Representation and Pre-training for Vision-Language Task
di: Zhang, Siyu, et al.
Pubblicazione: (2023) -
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
di: Kim, Minsu, et al.
Pubblicazione: (2024) -
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
di: Chen, Lan, et al.
Pubblicazione: (2025)