Unleashing the Potential of Vision-Language Pre-Training for 3D Zero-Shot Lesion Segmentation via Mask-Attribute Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Yankai, Lei, Wenhui, Zhang, Xiaofan, Zhang, Shaoting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ZePT: Zero-Shot Pan-Tumor Segmentation via Query-Disentangling and Self-Prompting
por: Jiang, Yankai, et al.
Publicado: (2023)
por: Jiang, Yankai, et al.
Publicado: (2023)
MedLSAM: Localize and Segment Anything Model for 3D CT Images
por: Lei, Wenhui, et al.
Publicado: (2023)
por: Lei, Wenhui, et al.
Publicado: (2023)
CAT: Coordinating Anatomical-Textual Prompts for Multi-Organ and Tumor Segmentation
por: Huang, Zhongzhen, et al.
Publicado: (2024)
por: Huang, Zhongzhen, et al.
Publicado: (2024)
Interactive Segmentation and Report Generation for CT Images
por: Gu, Yannian, et al.
Publicado: (2025)
por: Gu, Yannian, et al.
Publicado: (2025)
GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition
por: Dai, Guangzhao, et al.
Publicado: (2024)
por: Dai, Guangzhao, et al.
Publicado: (2024)
MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation
por: Zhao, Yibo, et al.
Publicado: (2026)
por: Zhao, Yibo, et al.
Publicado: (2026)
LesionDiffusion: Towards Text-controlled General Lesion Synthesis
por: Lei, Wenhui, et al.
Publicado: (2025)
por: Lei, Wenhui, et al.
Publicado: (2025)
Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models
por: Han, Chaolei, et al.
Publicado: (2025)
por: Han, Chaolei, et al.
Publicado: (2025)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
por: Li, Yunheng, et al.
Publicado: (2024)
por: Li, Yunheng, et al.
Publicado: (2024)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
por: Huang, Zhongzhen, et al.
Publicado: (2024)
por: Huang, Zhongzhen, et al.
Publicado: (2024)
OpenPath: Open-Set Active Learning for Pathology Image Classification via Pre-trained Vision-Language Models
por: Zhong, Lanfeng, et al.
Publicado: (2025)
por: Zhong, Lanfeng, et al.
Publicado: (2025)
PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution
por: Zhang, Yaning, et al.
Publicado: (2025)
por: Zhang, Yaning, et al.
Publicado: (2025)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
por: Deng, Hanqiu, et al.
Publicado: (2023)
por: Deng, Hanqiu, et al.
Publicado: (2023)
Zero-Shot Video Semantic Segmentation based on Pre-Trained Diffusion Models
por: Wang, Qian, et al.
Publicado: (2024)
por: Wang, Qian, et al.
Publicado: (2024)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
por: Yang, Zaiquan, et al.
Publicado: (2025)
por: Yang, Zaiquan, et al.
Publicado: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
por: Wei, Zhixiang, et al.
Publicado: (2026)
por: Wei, Zhixiang, et al.
Publicado: (2026)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
por: Liu, Kangcheng, et al.
Publicado: (2023)
por: Liu, Kangcheng, et al.
Publicado: (2023)
OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model
por: Zhang, Kunshen
Publicado: (2025)
por: Zhang, Kunshen
Publicado: (2025)
MaskHOI: Robust 3D Hand-Object Interaction Estimation via Masked Pre-training
por: Xie, Yuechen, et al.
Publicado: (2025)
por: Xie, Yuechen, et al.
Publicado: (2025)
OnlineAnySeg: Online Zero-Shot 3D Segmentation by Visual Foundation Model Guided 2D Mask Merging
por: Tang, Yijie, et al.
Publicado: (2025)
por: Tang, Yijie, et al.
Publicado: (2025)
STAGE: Segmentation-oriented Industrial Anomaly Synthesis via Graded Diffusion with Explicit Mask Alignment
por: Xu, Xichen, et al.
Publicado: (2025)
por: Xu, Xichen, et al.
Publicado: (2025)
MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation
por: Huang, Xun, et al.
Publicado: (2025)
por: Huang, Xun, et al.
Publicado: (2025)
Unleashing the Potential of Pre-Trained Diffusion Models for Generalizable Person Re-Identification
por: Li, Jiachen, et al.
Publicado: (2025)
por: Li, Jiachen, et al.
Publicado: (2025)
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
por: Hu, Junyi, et al.
Publicado: (2026)
por: Hu, Junyi, et al.
Publicado: (2026)
DeReStainer: H&E to IHC Pathological Image Translation via Decoupled Staining Channels
por: Wei, Linda, et al.
Publicado: (2024)
por: Wei, Linda, et al.
Publicado: (2024)
DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
por: Xu, Chaoran, et al.
Publicado: (2025)
por: Xu, Chaoran, et al.
Publicado: (2025)
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
por: Yu, Yongrui, et al.
Publicado: (2024)
por: Yu, Yongrui, et al.
Publicado: (2024)
Zero-Shot 4D Lidar Panoptic Segmentation
por: Zhang, Yushan, et al.
Publicado: (2025)
por: Zhang, Yushan, et al.
Publicado: (2025)
TSegAgent: Zero-Shot Tooth Segmentation via Geometry-Aware Vision-Language Agents
por: Zhuang, Shaojie, et al.
Publicado: (2026)
por: Zhuang, Shaojie, et al.
Publicado: (2026)
LesionLocator: Zero-Shot Universal Tumor Segmentation and Tracking in 3D Whole-Body Imaging
por: Rokuss, Maximilian, et al.
Publicado: (2025)
por: Rokuss, Maximilian, et al.
Publicado: (2025)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
por: Gao, Jin, et al.
Publicado: (2024)
por: Gao, Jin, et al.
Publicado: (2024)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
por: Li, Zhangpu, et al.
Publicado: (2024)
por: Li, Zhangpu, et al.
Publicado: (2024)
MedFLIP: Medical Vision-and-Language Self-supervised Fast Pre-Training with Masked Autoencoder
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
por: Das, Anurag, et al.
Publicado: (2024)
por: Das, Anurag, et al.
Publicado: (2024)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
por: Cai, Lingling, et al.
Publicado: (2024)
por: Cai, Lingling, et al.
Publicado: (2024)
A3-TTA: Adaptive Anchor Alignment Test-Time Adaptation for Image Segmentation
por: Wu, Jianghao, et al.
Publicado: (2026)
por: Wu, Jianghao, et al.
Publicado: (2026)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
por: Unmesh, Asim, et al.
Publicado: (2026)
por: Unmesh, Asim, et al.
Publicado: (2026)
Unifying Multiple Foundation Models for Advanced Computational Pathology
por: Lei, Wenhui, et al.
Publicado: (2025)
por: Lei, Wenhui, et al.
Publicado: (2025)
MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
por: Liu, Yunze, et al.
Publicado: (2024)
por: Liu, Yunze, et al.
Publicado: (2024)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
por: Chen, Tianrun, et al.
Publicado: (2024)
por: Chen, Tianrun, et al.
Publicado: (2024)
Ejemplares similares
-
ZePT: Zero-Shot Pan-Tumor Segmentation via Query-Disentangling and Self-Prompting
por: Jiang, Yankai, et al.
Publicado: (2023) -
MedLSAM: Localize and Segment Anything Model for 3D CT Images
por: Lei, Wenhui, et al.
Publicado: (2023) -
CAT: Coordinating Anatomical-Textual Prompts for Multi-Organ and Tumor Segmentation
por: Huang, Zhongzhen, et al.
Publicado: (2024) -
Interactive Segmentation and Report Generation for CT Images
por: Gu, Yannian, et al.
Publicado: (2025) -
GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition
por: Dai, Guangzhao, et al.
Publicado: (2024)