Explore In-Context Segmentation via Latent Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chaoyang, Li, Xiangtai, Ding, Henghui, Qi, Lu, Zhang, Jiangning, Tong, Yunhai, Loy, Chen Change, Yan, Shuicheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow
di: Wang, Chaoyang, et al.
Pubblicazione: (2024)
di: Wang, Chaoyang, et al.
Pubblicazione: (2024)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
di: Yuan, Haobo, et al.
Pubblicazione: (2024)
di: Yuan, Haobo, et al.
Pubblicazione: (2024)
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
di: Xu, Shilin, et al.
Pubblicazione: (2023)
di: Xu, Shilin, et al.
Pubblicazione: (2023)
OMG-Seg: Is One Model Good Enough For All Segmentation?
di: Li, Xiangtai, et al.
Pubblicazione: (2024)
di: Li, Xiangtai, et al.
Pubblicazione: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Transformer-Based Visual Segmentation: A Survey
di: Li, Xiangtai, et al.
Pubblicazione: (2023)
di: Li, Xiangtai, et al.
Pubblicazione: (2023)
One-Step Distillation of Discrete Diffusion Image Generators via Fixed-Point Iteration
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Point Cloud Mamba: Point Cloud Learning via State Space Model
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
Point-In-Context: Understanding Point Cloud via In-Context Learning
di: Liu, Mengyuan, et al.
Pubblicazione: (2024)
di: Liu, Mengyuan, et al.
Pubblicazione: (2024)
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
di: Zhou, Chong, et al.
Pubblicazione: (2023)
di: Zhou, Chong, et al.
Pubblicazione: (2023)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
di: Yuan, Haobo, et al.
Pubblicazione: (2024)
di: Yuan, Haobo, et al.
Pubblicazione: (2024)
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
di: Xie, Jiahao, et al.
Pubblicazione: (2023)
di: Xie, Jiahao, et al.
Pubblicazione: (2023)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
di: Zhou, Yikang, et al.
Pubblicazione: (2025)
di: Zhou, Yikang, et al.
Pubblicazione: (2025)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion Prior
di: Chen, Honghua, et al.
Pubblicazione: (2024)
di: Chen, Honghua, et al.
Pubblicazione: (2024)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
di: Zhou, Yikang, et al.
Pubblicazione: (2024)
di: Zhou, Yikang, et al.
Pubblicazione: (2024)
DifFace: Blind Face Restoration with Diffused Error Contraction
di: Yue, Zongsheng, et al.
Pubblicazione: (2022)
di: Yue, Zongsheng, et al.
Pubblicazione: (2022)
Efficient Diffusion Model for Image Restoration by Residual Shifting
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
Arbitrary-steps Image Super-resolution via Diffusion Inversion
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
di: Guo, Zujin, et al.
Pubblicazione: (2024)
di: Guo, Zujin, et al.
Pubblicazione: (2024)
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
di: Shi, Qingyu, et al.
Pubblicazione: (2025)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Omegance: A Single Parameter for Various Granularities in Diffusion-Based Synthesis
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
di: Wu, Size, et al.
Pubblicazione: (2023)
di: Wu, Size, et al.
Pubblicazione: (2023)
Guiding Visual Autoregressive Models through Spectrum Weakening
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Towards Open Vocabulary Learning: A Survey
di: Wu, Jianzong, et al.
Pubblicazione: (2023)
di: Wu, Jianzong, et al.
Pubblicazione: (2023)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
Kalman-Inspired Feature Propagation for Video Face Super-Resolution
di: Feng, Ruicheng, et al.
Pubblicazione: (2024)
di: Feng, Ruicheng, et al.
Pubblicazione: (2024)
AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
Rethinking Vector Field Learning for Generative Segmentation
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
DC-SAM: In-Context Segment Anything in Images and Videos via Dual Consistency
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
MOWA: Multiple-in-One Image Warping Model
di: Liao, Kang, et al.
Pubblicazione: (2024)
di: Liao, Kang, et al.
Pubblicazione: (2024)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
di: Xu, Shilin, et al.
Pubblicazione: (2024)
di: Xu, Shilin, et al.
Pubblicazione: (2024)
Boosting Reasoning in Large Multimodal Models via Activation Replay
di: Xing, Yun, et al.
Pubblicazione: (2025)
di: Xing, Yun, et al.
Pubblicazione: (2025)
Control Color: Multimodal Diffusion-based Interactive Image Colorization
di: Liang, Zhexin, et al.
Pubblicazione: (2024)
di: Liang, Zhexin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow
di: Wang, Chaoyang, et al.
Pubblicazione: (2024) -
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
di: Yuan, Haobo, et al.
Pubblicazione: (2024) -
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
di: Xu, Shilin, et al.
Pubblicazione: (2023) -
OMG-Seg: Is One Model Good Enough For All Segmentation?
di: Li, Xiangtai, et al.
Pubblicazione: (2024) -
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
di: Wu, Jianzong, et al.
Pubblicazione: (2024)