Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Danni, Dong, Ruohan, Ji, Jiayi, Ma, Yiwei, Wang, Haowei, Sun, Xiaoshuai, Ji, Rongrong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
di: Ji, Jiayi, et al.
Pubblicazione: (2023)
di: Ji, Jiayi, et al.
Pubblicazione: (2023)
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
di: Liu, Sihan, et al.
Pubblicazione: (2023)
di: Liu, Sihan, et al.
Pubblicazione: (2023)
Any-to-3D Generation via Hybrid Diffusion Supervision
di: Fan, Yijun, et al.
Pubblicazione: (2024)
di: Fan, Yijun, et al.
Pubblicazione: (2024)
X-Dreamer: Creating High-quality 3D Content by Bridging the Domain Gap Between Text-to-2D and Text-to-3D Generation
di: Ma, Yiwei, et al.
Pubblicazione: (2023)
di: Ma, Yiwei, et al.
Pubblicazione: (2023)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
di: Liu, Luping, et al.
Pubblicazione: (2024)
di: Liu, Luping, et al.
Pubblicazione: (2024)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
X-Oscar: A Progressive Framework for High-quality Text-guided 3D Animatable Avatar Generation
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2023)
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2023)
Long-Range Feature Propagating for Natural Image Matting
di: Liu, Qinglin, et al.
Pubblicazione: (2021)
di: Liu, Qinglin, et al.
Pubblicazione: (2021)
SafePaint: Anti-forensic Image Inpainting with Domain Adaptation
di: Chen, Dunyun, et al.
Pubblicazione: (2024)
di: Chen, Dunyun, et al.
Pubblicazione: (2024)
Language-Guided Diffusion Model for Visual Grounding
di: Chen, Sijia, et al.
Pubblicazione: (2023)
di: Chen, Sijia, et al.
Pubblicazione: (2023)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
di: Wang, Xinghan, et al.
Pubblicazione: (2024)
di: Wang, Xinghan, et al.
Pubblicazione: (2024)
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation
di: Chen, Qi, et al.
Pubblicazione: (2025)
di: Chen, Qi, et al.
Pubblicazione: (2025)
Image Captioning via Dynamic Path Customization
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness
di: Cha, SeungJu, et al.
Pubblicazione: (2025)
di: Cha, SeungJu, et al.
Pubblicazione: (2025)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
NeR-SC: Adapting Neural Video Representation to Screen Content
di: Shi, Ruohan, et al.
Pubblicazione: (2026)
di: Shi, Ruohan, et al.
Pubblicazione: (2026)
Exploring Palette based Color Guidance in Diffusion Models
di: Qiu, Qianru, et al.
Pubblicazione: (2025)
di: Qiu, Qianru, et al.
Pubblicazione: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
SonoWorld: From One Image to a 3D Audio-Visual Scene
di: Jin, Derong, et al.
Pubblicazione: (2026)
di: Jin, Derong, et al.
Pubblicazione: (2026)
3D-GRES: Generalized 3D Referring Expression Segmentation
di: Wu, Changli, et al.
Pubblicazione: (2024)
di: Wu, Changli, et al.
Pubblicazione: (2024)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
di: Qin, You, et al.
Pubblicazione: (2024)
di: Qin, You, et al.
Pubblicazione: (2024)
Feature CAM: Interpretable AI in Image Classification
di: Clement, Frincy, et al.
Pubblicazione: (2024)
di: Clement, Frincy, et al.
Pubblicazione: (2024)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
di: Yang, Danni, et al.
Pubblicazione: (2024) -
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025) -
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
di: Ji, Jiayi, et al.
Pubblicazione: (2023) -
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
di: Liu, Sihan, et al.
Pubblicazione: (2023) -
Any-to-3D Generation via Hybrid Diffusion Supervision
di: Fan, Yijun, et al.
Pubblicazione: (2024)