FashionM3: Multimodal, Multitask, and Multiround Fashion Assistant based on Unified Vision-Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pang, Kaicheng, Zou, Xingxing, Wong, Waikeung |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dress Well via Fashion Cognitive Learning
par: Pang, Kaicheng, et autres
Publié: (2022)
par: Pang, Kaicheng, et autres
Publié: (2022)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
FashionSD-X: Multimodal Fashion Garment Synthesis using Latent Diffusion
par: Singh, Abhishek Kumar, et autres
Publié: (2024)
par: Singh, Abhishek Kumar, et autres
Publié: (2024)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
par: Sanguigni, Fulvio, et autres
Publié: (2025)
par: Sanguigni, Fulvio, et autres
Publié: (2025)
FashionFail: Addressing Failure Cases in Fashion Object Detection and Segmentation
par: Velioglu, Riza, et autres
Publié: (2024)
par: Velioglu, Riza, et autres
Publié: (2024)
FashionFlow: Leveraging Diffusion Models for Dynamic Fashion Video Synthesis from Static Imagery
par: Islam, Tasin, et autres
Publié: (2023)
par: Islam, Tasin, et autres
Publié: (2023)
DPDEdit: Detail-Preserved Diffusion Models for Multimodal Fashion Image Editing
par: Wang, Xiaolong, et autres
Publié: (2024)
par: Wang, Xiaolong, et autres
Publié: (2024)
ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language Pretraining
par: Song, Chull Hwan, et autres
Publié: (2024)
par: Song, Chull Hwan, et autres
Publié: (2024)
FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data
par: Yuan, Peng, et autres
Publié: (2026)
par: Yuan, Peng, et autres
Publié: (2026)
REB: Reducing Biases in Representation for Industrial Anomaly Detection
par: Lyu, Shuai, et autres
Publié: (2023)
par: Lyu, Shuai, et autres
Publié: (2023)
Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts
par: Choi, Jinyoung, et autres
Publié: (2025)
par: Choi, Jinyoung, et autres
Publié: (2025)
FEAT: Fashion Editing and Try-On from Any Design
par: Kwon, Soye, et autres
Publié: (2026)
par: Kwon, Soye, et autres
Publié: (2026)
Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories
par: Hu, Junyao, et autres
Publié: (2026)
par: Hu, Junyao, et autres
Publié: (2026)
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
FashionLOGO: Prompting Multimodal Large Language Models for Fashion Logo Embeddings
par: Wang, Zhen, et autres
Publié: (2023)
par: Wang, Zhen, et autres
Publié: (2023)
TalkFashion: Intelligent Virtual Try-On Assistant Based on Multimodal Large Language Model
par: Hu, Yujie, et autres
Publié: (2025)
par: Hu, Yujie, et autres
Publié: (2025)
MVREC: A General Few-shot Defect Classification Model Using Multi-View Region-Context
par: Lyu, Shuai, et autres
Publié: (2024)
par: Lyu, Shuai, et autres
Publié: (2024)
Pose-Star: Anatomy-Aware Editing for Open-World Fashion Images
par: Dong, Yuran, et autres
Publié: (2025)
par: Dong, Yuran, et autres
Publié: (2025)
Holi-DETR: Holistic Fashion Item Detection Leveraging Contextual Information
par: Kwon, Youngchae, et autres
Publié: (2025)
par: Kwon, Youngchae, et autres
Publié: (2025)
ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images
par: Naik, Prithviraj Purushottam, et autres
Publié: (2024)
par: Naik, Prithviraj Purushottam, et autres
Publié: (2024)
Training-Free Consistency Pipeline for Fashion Repose
par: Aghilar, Potito, et autres
Publié: (2025)
par: Aghilar, Potito, et autres
Publié: (2025)
LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
par: Girella, Federico, et autres
Publié: (2025)
par: Girella, Federico, et autres
Publié: (2025)
RadVLM: A Multitask Conversational Vision-Language Model for Radiology
par: Deperrois, Nicolas, et autres
Publié: (2025)
par: Deperrois, Nicolas, et autres
Publié: (2025)
PAE: LLM-based Product Attribute Extraction for E-Commerce Fashion Trends
par: Sinha, Apurva, et autres
Publié: (2024)
par: Sinha, Apurva, et autres
Publié: (2024)
From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation
par: Gondal, Moazzam Umer, et autres
Publié: (2025)
par: Gondal, Moazzam Umer, et autres
Publié: (2025)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
par: Huang, Jiale, et autres
Publié: (2024)
par: Huang, Jiale, et autres
Publié: (2024)
Fashion Florence: Fine-Tuning Florence-2 for Structured Fashion Attribute Extraction
par: Berlia, Anushree
Publié: (2026)
par: Berlia, Anushree
Publié: (2026)
OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning
par: Yang, Zhengwei, et autres
Publié: (2026)
par: Yang, Zhengwei, et autres
Publié: (2026)
CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis
par: Liang, Kaidi, et autres
Publié: (2025)
par: Liang, Kaidi, et autres
Publié: (2025)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
par: Mei, Guofeng, et autres
Publié: (2024)
par: Mei, Guofeng, et autres
Publié: (2024)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
par: Huang, Zhengchao, et autres
Publié: (2024)
par: Huang, Zhengchao, et autres
Publié: (2024)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
par: Huang, Haochen, et autres
Publié: (2025)
par: Huang, Haochen, et autres
Publié: (2025)
FashionR2R: Texture-preserving Rendered-to-Real Image Translation with Diffusion Models
par: Hu, Rui, et autres
Publié: (2024)
par: Hu, Rui, et autres
Publié: (2024)
The Impact of Background Removal on Performance of Neural Networks for Fashion Image Classification and Segmentation
par: Liang, Junhui, et autres
Publié: (2023)
par: Liang, Junhui, et autres
Publié: (2023)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
par: Zhang, Zhixin, et autres
Publié: (2024)
par: Zhang, Zhixin, et autres
Publié: (2024)
A Multihead Continual Learning Framework for Fine-Grained Fashion Image Retrieval with Contrastive Learning and Exponential Moving Average Distillation
par: Xiao, Ling, et autres
Publié: (2026)
par: Xiao, Ling, et autres
Publié: (2026)
RAVEN: Multitask Retrieval Augmented Vision-Language Learning
par: Rao, Varun Nagaraj, et autres
Publié: (2024)
par: Rao, Varun Nagaraj, et autres
Publié: (2024)
FashionComposer: Compositional Fashion Image Generation
par: Ji, Sihui, et autres
Publié: (2024)
par: Ji, Sihui, et autres
Publié: (2024)
FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding
par: Feng, Kaidong, et autres
Publié: (2026)
par: Feng, Kaidong, et autres
Publié: (2026)
Documents similaires
-
Dress Well via Fashion Cognitive Learning
par: Pang, Kaicheng, et autres
Publié: (2022) -
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
par: Zhao, Xiangyu, et autres
Publié: (2024) -
FashionSD-X: Multimodal Fashion Garment Synthesis using Latent Diffusion
par: Singh, Abhishek Kumar, et autres
Publié: (2024) -
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
par: Sanguigni, Fulvio, et autres
Publié: (2025) -
FashionFail: Addressing Failure Cases in Fashion Object Detection and Segmentation
par: Velioglu, Riza, et autres
Publié: (2024)