UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Haiyang, Yi, Siyang, Niu, Ke, Zhuo, Minghan, Li, Bin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ChatReID: Open-ended Interactive Person Retrieval via Hierarchical Progressive Tuning for Vision Language Models
por: Niu, Ke, et al.
Publicado: (2025)
por: Niu, Ke, et al.
Publicado: (2025)
IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning
por: Zhao, Mengyang, et al.
Publicado: (2025)
por: Zhao, Mengyang, et al.
Publicado: (2025)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
Gaze-directed Vision GNN for Mitigating Shortcut Learning in Medical Image
por: Wu, Shaoxuan, et al.
Publicado: (2024)
por: Wu, Shaoxuan, et al.
Publicado: (2024)
MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling
por: Liu, Jiyao, et al.
Publicado: (2026)
por: Liu, Jiyao, et al.
Publicado: (2026)
UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models
por: Liao, Zehui, et al.
Publicado: (2025)
por: Liao, Zehui, et al.
Publicado: (2025)
Task-Specific Knowledge Distillation from the Vision Foundation Model for Enhanced Medical Image Segmentation
por: Liang, Pengchen, et al.
Publicado: (2025)
por: Liang, Pengchen, et al.
Publicado: (2025)
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
por: Li, Yujie, et al.
Publicado: (2024)
por: Li, Yujie, et al.
Publicado: (2024)
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
por: Li, Weiqi, et al.
Publicado: (2025)
por: Li, Weiqi, et al.
Publicado: (2025)
DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?
por: Zhou, Tianhong, et al.
Publicado: (2025)
por: Zhou, Tianhong, et al.
Publicado: (2025)
AMR-CCR: Anchored Modular Retrieval for Continual Chinese Character Recognition
por: Wu, Yuchuan, et al.
Publicado: (2026)
por: Wu, Yuchuan, et al.
Publicado: (2026)
Conceptual Codebook Learning for Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
por: Xu, Jinjin, et al.
Publicado: (2023)
por: Xu, Jinjin, et al.
Publicado: (2023)
CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging
por: Kumar, Ashwin, et al.
Publicado: (2026)
por: Kumar, Ashwin, et al.
Publicado: (2026)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
por: Fu, Teng, et al.
Publicado: (2025)
por: Fu, Teng, et al.
Publicado: (2025)
Unifying 3D Vision-Language Understanding via Promptable Queries
por: Zhu, Ziyu, et al.
Publicado: (2024)
por: Zhu, Ziyu, et al.
Publicado: (2024)
Synthesizing Efficient Data with Diffusion Models for Person Re-Identification Pre-Training
por: Niu, Ke, et al.
Publicado: (2024)
por: Niu, Ke, et al.
Publicado: (2024)
CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
por: Niu, Ke, et al.
Publicado: (2025)
por: Niu, Ke, et al.
Publicado: (2025)
Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation
por: Yu, Wenjun, et al.
Publicado: (2025)
por: Yu, Wenjun, et al.
Publicado: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
por: Li, Xudong, et al.
Publicado: (2024)
por: Li, Xudong, et al.
Publicado: (2024)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
por: Zhan, Yang, et al.
Publicado: (2024)
por: Zhan, Yang, et al.
Publicado: (2024)
AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks
por: Li, You, et al.
Publicado: (2024)
por: Li, You, et al.
Publicado: (2024)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction
por: Yang, Lan, et al.
Publicado: (2026)
por: Yang, Lan, et al.
Publicado: (2026)
Mixture of Prompt Learning for Vision Language Models
por: Du, Yu, et al.
Publicado: (2024)
por: Du, Yu, et al.
Publicado: (2024)
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
PHT-CAD: Efficient CAD Parametric Primitive Analysis with Progressive Hierarchical Tuning
por: Niu, Ke, et al.
Publicado: (2025)
por: Niu, Ke, et al.
Publicado: (2025)
Controlling Vision-Language Models for Multi-Task Image Restoration
por: Luo, Ziwei, et al.
Publicado: (2023)
por: Luo, Ziwei, et al.
Publicado: (2023)
Concept-Guided Prompt Learning for Generalization in Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
Vision-Language Enhanced Foundation Model for Semi-supervised Medical Image Segmentation
por: Guo, Jiaqi, et al.
Publicado: (2025)
por: Guo, Jiaqi, et al.
Publicado: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
por: Wei, Zhixiang, et al.
Publicado: (2026)
por: Wei, Zhixiang, et al.
Publicado: (2026)
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
por: Wu, Yuchuan, et al.
Publicado: (2026)
por: Wu, Yuchuan, et al.
Publicado: (2026)
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
por: Cao, Bin, et al.
Publicado: (2024)
por: Cao, Bin, et al.
Publicado: (2024)
Structural Graph Probing of Vision-Language Models
por: He, Haoyu, et al.
Publicado: (2026)
por: He, Haoyu, et al.
Publicado: (2026)
All-In-One Medical Image Restoration via Task-Adaptive Routing
por: Yang, Zhiwen, et al.
Publicado: (2024)
por: Yang, Zhiwen, et al.
Publicado: (2024)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
Ejemplares similares
-
ChatReID: Open-ended Interactive Person Retrieval via Hierarchical Progressive Tuning for Vision Language Models
por: Niu, Ke, et al.
Publicado: (2025) -
IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning
por: Zhao, Mengyang, et al.
Publicado: (2025) -
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
por: Ren, Sucheng, et al.
Publicado: (2024) -
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024) -
Gaze-directed Vision GNN for Mitigating Shortcut Learning in Medical Image
por: Wu, Shaoxuan, et al.
Publicado: (2024)