Language-Guided Diffusion Model for Visual Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Sijia, Li, Baochun |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
par: Jin, Hyundong, et autres
Publié: (2025)
par: Jin, Hyundong, et autres
Publié: (2025)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
par: Wan, Siqi, et autres
Publié: (2025)
par: Wan, Siqi, et autres
Publié: (2025)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
par: Mao, Qingyang, et autres
Publié: (2025)
par: Mao, Qingyang, et autres
Publié: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024)
par: Yang, Danni, et autres
Publié: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
par: Qu, Mengxue, et autres
Publié: (2024)
par: Qu, Mengxue, et autres
Publié: (2024)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
Visual Grounding with Multi-modal Conditional Adaptation
par: Yao, Ruilin, et autres
Publié: (2024)
par: Yao, Ruilin, et autres
Publié: (2024)
Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation
par: Liu, Gang, et autres
Publié: (2024)
par: Liu, Gang, et autres
Publié: (2024)
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
par: Guan, Runwei, et autres
Publié: (2024)
par: Guan, Runwei, et autres
Publié: (2024)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
par: Liao, Liwei, et autres
Publié: (2025)
par: Liao, Liwei, et autres
Publié: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
par: Sun, Hao, et autres
Publié: (2025)
par: Sun, Hao, et autres
Publié: (2025)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
par: Yu, Lijun, et autres
Publié: (2023)
par: Yu, Lijun, et autres
Publié: (2023)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
par: Li, Yinqi, et autres
Publié: (2025)
par: Li, Yinqi, et autres
Publié: (2025)
Mono3DVG-EnSD: Enhanced Spatial-aware and Dimension-decoupled Text Encoding for Monocular 3D Visual Grounding
par: Li, Yuzhen, et autres
Publié: (2025)
par: Li, Yuzhen, et autres
Publié: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
par: Hao, Bowen, et autres
Publié: (2025)
par: Hao, Bowen, et autres
Publié: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
par: Li, Huilai, et autres
Publié: (2025)
par: Li, Huilai, et autres
Publié: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
par: Feng, X., et autres
Publié: (2024)
par: Feng, X., et autres
Publié: (2024)
Improving Virtual Try-On with Garment-focused Diffusion Models
par: Wan, Siqi, et autres
Publié: (2024)
par: Wan, Siqi, et autres
Publié: (2024)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
Magic3DSketch: Create Colorful 3D Models From Sketch-Based 3D Modeling Guided by Text and Language-Image Pre-Training
par: Zang, Ying, et autres
Publié: (2024)
par: Zang, Ying, et autres
Publié: (2024)
Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion
par: Zheng, Guoquan, et autres
Publié: (2026)
par: Zheng, Guoquan, et autres
Publié: (2026)
Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
par: Tang, Shengeng, et autres
Publié: (2024)
par: Tang, Shengeng, et autres
Publié: (2024)
Scene Graph Generation with Role-Playing Large Language Models
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
Holistic Visual-Textual Sentiment Analysis with Prior Models
par: Chen, Junyu, et autres
Publié: (2022)
par: Chen, Junyu, et autres
Publié: (2022)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
A Novel Approach to Industrial Defect Generation through Blended Latent Diffusion Model with Online Adaptation
par: Li, Hanxi, et autres
Publié: (2024)
par: Li, Hanxi, et autres
Publié: (2024)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
par: Song, Shezheng, et autres
Publié: (2026)
par: Song, Shezheng, et autres
Publié: (2026)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
par: Hu, Ying, et autres
Publié: (2024)
par: Hu, Ying, et autres
Publié: (2024)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
par: Li, Yanjun, et autres
Publié: (2025)
par: Li, Yanjun, et autres
Publié: (2025)
Documents similaires
-
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
par: Jin, Hyundong, et autres
Publié: (2025) -
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
par: Wan, Siqi, et autres
Publié: (2025) -
Visual Autoregressive Modeling for Instruction-Guided Image Editing
par: Mao, Qingyang, et autres
Publié: (2025) -
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
par: Yang, Danni, et autres
Publié: (2024) -
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
par: Qu, Mengxue, et autres
Publié: (2024)