MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Jiahao, Li, Wei, Li, Xiangtai, Liu, Ziwei, Ong, Yew Soon, Loy, Chen Change |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
por: Xu, Shilin, et al.
Publicado: (2023)
por: Xu, Shilin, et al.
Publicado: (2023)
Explore In-Context Segmentation via Latent Diffusion Models
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
por: Wu, Size, et al.
Publicado: (2023)
por: Wu, Size, et al.
Publicado: (2023)
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
por: Zhou, Chong, et al.
Publicado: (2023)
por: Zhou, Chong, et al.
Publicado: (2023)
OMG-Seg: Is One Model Good Enough For All Segmentation?
por: Li, Xiangtai, et al.
Publicado: (2024)
por: Li, Xiangtai, et al.
Publicado: (2024)
Transformer-Based Visual Segmentation: A Survey
por: Li, Xiangtai, et al.
Publicado: (2023)
por: Li, Xiangtai, et al.
Publicado: (2023)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
por: Guo, Zujin, et al.
Publicado: (2024)
por: Guo, Zujin, et al.
Publicado: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
Make Me Happier: Evoking Emotions Through Image Diffusion Models
por: Lin, Qing, et al.
Publicado: (2024)
por: Lin, Qing, et al.
Publicado: (2024)
Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
por: Wang, Fangjinhua, et al.
Publicado: (2025)
por: Wang, Fangjinhua, et al.
Publicado: (2025)
DifFace: Blind Face Restoration with Diffused Error Contraction
por: Yue, Zongsheng, et al.
Publicado: (2022)
por: Yue, Zongsheng, et al.
Publicado: (2022)
Omegance: A Single Parameter for Various Granularities in Diffusion-Based Synthesis
por: Hou, Xinyu, et al.
Publicado: (2024)
por: Hou, Xinyu, et al.
Publicado: (2024)
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
Efficient Diffusion Model for Image Restoration by Residual Shifting
por: Yue, Zongsheng, et al.
Publicado: (2024)
por: Yue, Zongsheng, et al.
Publicado: (2024)
MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion Prior
por: Chen, Honghua, et al.
Publicado: (2024)
por: Chen, Honghua, et al.
Publicado: (2024)
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023)
por: Zang, Yuhang, et al.
Publicado: (2023)
Control Color: Multimodal Diffusion-based Interactive Image Colorization
por: Liang, Zhexin, et al.
Publicado: (2024)
por: Liang, Zhexin, et al.
Publicado: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
por: Li, Xiaoming, et al.
Publicado: (2025)
por: Li, Xiaoming, et al.
Publicado: (2025)
Kalman-Inspired Feature Propagation for Video Face Super-Resolution
por: Feng, Ruicheng, et al.
Publicado: (2024)
por: Feng, Ruicheng, et al.
Publicado: (2024)
AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation
por: Hou, Xinyu, et al.
Publicado: (2024)
por: Hou, Xinyu, et al.
Publicado: (2024)
Point-In-Context: Understanding Point Cloud via In-Context Learning
por: Liu, Mengyuan, et al.
Publicado: (2024)
por: Liu, Mengyuan, et al.
Publicado: (2024)
F-LMM: Grounding Frozen Large Multimodal Models
por: Wu, Size, et al.
Publicado: (2024)
por: Wu, Size, et al.
Publicado: (2024)
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
por: Yang, Shuai, et al.
Publicado: (2025)
por: Yang, Shuai, et al.
Publicado: (2025)
Eliminating Feature Ambiguity for Few-Shot Segmentation
por: Xu, Qianxiong, et al.
Publicado: (2024)
por: Xu, Qianxiong, et al.
Publicado: (2024)
GroupDiff: Diffusion-based Group Portrait Editing
por: Jiang, Yuming, et al.
Publicado: (2024)
por: Jiang, Yuming, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
Arbitrary-steps Image Super-resolution via Diffusion Inversion
por: Yue, Zongsheng, et al.
Publicado: (2024)
por: Yue, Zongsheng, et al.
Publicado: (2024)
Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation
por: Lee, Junha, et al.
Publicado: (2025)
por: Lee, Junha, et al.
Publicado: (2025)
Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation
por: Fang, Hao, et al.
Publicado: (2024)
por: Fang, Hao, et al.
Publicado: (2024)
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
por: Dai, Yuekun, et al.
Publicado: (2025)
por: Dai, Yuekun, et al.
Publicado: (2025)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
por: Zhu, Wenqi, et al.
Publicado: (2024)
por: Zhu, Wenqi, et al.
Publicado: (2024)
Controllable Human-centric Keyframe Interpolation with Generative Prior
por: Guo, Zujin, et al.
Publicado: (2025)
por: Guo, Zujin, et al.
Publicado: (2025)
MOWA: Multiple-in-One Image Warping Model
por: Liao, Kang, et al.
Publicado: (2024)
por: Liao, Kang, et al.
Publicado: (2024)
Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation
por: Li, Jiahao, et al.
Publicado: (2026)
por: Li, Jiahao, et al.
Publicado: (2026)
3DEnhancer: Consistent Multi-View Diffusion for 3D Enhancement
por: Luo, Yihang, et al.
Publicado: (2024)
por: Luo, Yihang, et al.
Publicado: (2024)
Fine-grained Abnormality Prompt Learning for Zero-shot Anomaly Detection
por: Zhu, Jiawen, et al.
Publicado: (2024)
por: Zhu, Jiawen, et al.
Publicado: (2024)
Learning 3D Garment Animation from Trajectories of A Piece of Cloth
por: Shao, Yidi, et al.
Publicado: (2025)
por: Shao, Yidi, et al.
Publicado: (2025)
Learning Inclusion Matching for Animation Paint Bucket Colorization
por: Dai, Yuekun, et al.
Publicado: (2024)
por: Dai, Yuekun, et al.
Publicado: (2024)
Ejemplares similares
-
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
por: Yuan, Haobo, et al.
Publicado: (2024) -
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
por: Xu, Shilin, et al.
Publicado: (2023) -
Explore In-Context Segmentation via Latent Diffusion Models
por: Wang, Chaoyang, et al.
Publicado: (2024) -
CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
por: Wu, Size, et al.
Publicado: (2023) -
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
por: Zhou, Chong, et al.
Publicado: (2023)