MASTER: Multimodal Segmentation with Text Prompts
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Fuyang, Lu, Shun, Mei, Jilin, Hu, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CORENet: Cross-Modal 4D Radar Denoising Network with LiDAR Supervision for Autonomous Driving
di: Liu, Fuyang, et al.
Pubblicazione: (2025)
di: Liu, Fuyang, et al.
Pubblicazione: (2025)
PID: Physics-Informed Diffusion Model for Infrared Image Generation
di: Mao, Fangyuan, et al.
Pubblicazione: (2024)
di: Mao, Fangyuan, et al.
Pubblicazione: (2024)
Prompt Group-Aware Training for Robust Text-Guided Nuclei Segmentation
di: Wu, Yonghuang, et al.
Pubblicazione: (2026)
di: Wu, Yonghuang, et al.
Pubblicazione: (2026)
Proto-OOD: Enhancing OOD Object Detection with Prototype Feature Similarity
di: Chen, Junkun, et al.
Pubblicazione: (2024)
di: Chen, Junkun, et al.
Pubblicazione: (2024)
Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
di: Peng, Xingkai, et al.
Pubblicazione: (2025)
di: Peng, Xingkai, et al.
Pubblicazione: (2025)
Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction
di: Guan, Wenfei, et al.
Pubblicazione: (2025)
di: Guan, Wenfei, et al.
Pubblicazione: (2025)
WildOcc: A Benchmark for Off-Road 3D Semantic Occupancy Prediction
di: Zhai, Heng, et al.
Pubblicazione: (2024)
di: Zhai, Heng, et al.
Pubblicazione: (2024)
Face-MakeUp: Multimodal Facial Prompts for Text-to-Image Generation
di: Dai, Dawei, et al.
Pubblicazione: (2025)
di: Dai, Dawei, et al.
Pubblicazione: (2025)
TextSAM-EUS: Text Prompt Learning for SAM to Accurately Segment Pancreatic Tumor in Endoscopic Ultrasound
di: Spiegler, Pascal, et al.
Pubblicazione: (2025)
di: Spiegler, Pascal, et al.
Pubblicazione: (2025)
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
di: Wu, Shang, et al.
Pubblicazione: (2026)
di: Wu, Shang, et al.
Pubblicazione: (2026)
Batch-Instructed Gradient for Prompt Evolution:Systematic Prompt Optimization for Enhanced Text-to-Image Synthesis
di: Yang, Xinrui, et al.
Pubblicazione: (2024)
di: Yang, Xinrui, et al.
Pubblicazione: (2024)
UNIV: Unified Foundation Model for Infrared and Visible Modalities
di: Mao, Fangyuan, et al.
Pubblicazione: (2025)
di: Mao, Fangyuan, et al.
Pubblicazione: (2025)
Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation
di: Ahmad, Kaleem
Pubblicazione: (2025)
di: Ahmad, Kaleem
Pubblicazione: (2025)
Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout
di: QI, Anbin, et al.
Pubblicazione: (2024)
di: QI, Anbin, et al.
Pubblicazione: (2024)
Federated Class-Incremental Learning with Prompting
di: Luo, Xin, et al.
Pubblicazione: (2023)
di: Luo, Xin, et al.
Pubblicazione: (2023)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
Region Prompt Tuning: Fine-grained Scene Text Detection Utilizing Region Text Prompt
di: Lin, Xingtao, et al.
Pubblicazione: (2024)
di: Lin, Xingtao, et al.
Pubblicazione: (2024)
Reverse Prompt: Cracking the Recipe Inside Text-to-Image Generation
di: Ren, Zhiyao, et al.
Pubblicazione: (2025)
di: Ren, Zhiyao, et al.
Pubblicazione: (2025)
15M Multimodal Facial Image-Text Dataset
di: Dai, Dawei, et al.
Pubblicazione: (2024)
di: Dai, Dawei, et al.
Pubblicazione: (2024)
SAMAug: Point Prompt Augmentation for Segment Anything Model
di: Dai, Haixing, et al.
Pubblicazione: (2023)
di: Dai, Haixing, et al.
Pubblicazione: (2023)
XBusNet: Text-Guided Breast Ultrasound Segmentation via Multimodal Vision-Language Learning
di: Mallina, Raja, et al.
Pubblicazione: (2025)
di: Mallina, Raja, et al.
Pubblicazione: (2025)
WAS: Dataset and Methods for Artistic Text Segmentation
di: Xie, Xudong, et al.
Pubblicazione: (2024)
di: Xie, Xudong, et al.
Pubblicazione: (2024)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
di: Zhou, Qiji, et al.
Pubblicazione: (2024)
Multimodal Robust Prompt Distillation for 3D Point Cloud Models
di: Gu, Xiang, et al.
Pubblicazione: (2025)
di: Gu, Xiang, et al.
Pubblicazione: (2025)
TextMatch: Enhancing Image-Text Consistency Through Multimodal Optimization
di: Luo, Yucong, et al.
Pubblicazione: (2024)
di: Luo, Yucong, et al.
Pubblicazione: (2024)
Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation
di: Lu, Xiaoxin, et al.
Pubblicazione: (2025)
di: Lu, Xiaoxin, et al.
Pubblicazione: (2025)
Position: Towards Implicit Prompt For Text-To-Image Models
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
B-Rep Distance Functions (BR-DF): How to Represent a B-Rep Model by Volumetric Distance Functions?
di: Zhang, Fuyang, et al.
Pubblicazione: (2025)
di: Zhang, Fuyang, et al.
Pubblicazione: (2025)
Memory-Inspired Temporal Prompt Interaction for Text-Image Classification
di: Yu, Xinyao, et al.
Pubblicazione: (2024)
di: Yu, Xinyao, et al.
Pubblicazione: (2024)
Text Embedded Swin-UMamba for DeepLesion Segmentation
di: Cheng, Ruida, et al.
Pubblicazione: (2025)
di: Cheng, Ruida, et al.
Pubblicazione: (2025)
PromptDx: Differentiable Prompt Tuning for Multimodal In-Context Alzheimer's Diagnosis
di: Zhong, Lujia, et al.
Pubblicazione: (2026)
di: Zhong, Lujia, et al.
Pubblicazione: (2026)
Towards Universal Text-driven CT Image Segmentation
di: Li, Yuheng, et al.
Pubblicazione: (2025)
di: Li, Yuheng, et al.
Pubblicazione: (2025)
Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models
di: Rasaee, Hamza, et al.
Pubblicazione: (2025)
di: Rasaee, Hamza, et al.
Pubblicazione: (2025)
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
Visual Prompt Selection for In-Context Learning Segmentation
di: Suo, Wei, et al.
Pubblicazione: (2024)
di: Suo, Wei, et al.
Pubblicazione: (2024)
MedPromptX: Grounded Multimodal Prompting for Chest X-ray Diagnosis
di: Shaaban, Mai A., et al.
Pubblicazione: (2024)
di: Shaaban, Mai A., et al.
Pubblicazione: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
di: Zhang, Jielu, et al.
Pubblicazione: (2023)
di: Zhang, Jielu, et al.
Pubblicazione: (2023)
Dynamic Prompt Optimizing for Text-to-Image Generation
di: Mo, Wenyi, et al.
Pubblicazione: (2024)
di: Mo, Wenyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CORENet: Cross-Modal 4D Radar Denoising Network with LiDAR Supervision for Autonomous Driving
di: Liu, Fuyang, et al.
Pubblicazione: (2025) -
PID: Physics-Informed Diffusion Model for Infrared Image Generation
di: Mao, Fangyuan, et al.
Pubblicazione: (2024) -
Prompt Group-Aware Training for Robust Text-Guided Nuclei Segmentation
di: Wu, Yonghuang, et al.
Pubblicazione: (2026) -
Proto-OOD: Enhancing OOD Object Detection with Prototype Feature Similarity
di: Chen, Junkun, et al.
Pubblicazione: (2024) -
Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
di: Peng, Xingkai, et al.
Pubblicazione: (2025)