SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Xu, Yuan, Jin, Zhang, Hanwang, Zhong, Guojin, Zang, Yongsheng, Lin, Jiacheng, Li, Zhiyong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
by: Zeng, Kang, et al.
Published: (2025)
by: Zeng, Kang, et al.
Published: (2025)
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
by: Chen, Jiajun, et al.
Published: (2023)
by: Chen, Jiajun, et al.
Published: (2023)
Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
by: Wang, Yuxuan, et al.
Published: (2025)
by: Wang, Yuxuan, et al.
Published: (2025)
Image Synthesis with Graph Conditioning: CLIP-Guided Diffusion Models for Scene Graphs
by: Mishra, Rameshwar, et al.
Published: (2024)
by: Mishra, Rameshwar, et al.
Published: (2024)
NICEST: Noisy Label Correction and Training for Robust Scene Graph Generation
by: Li, Lin, et al.
Published: (2022)
by: Li, Lin, et al.
Published: (2022)
PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation
by: Zhang, Xu, et al.
Published: (2023)
by: Zhang, Xu, et al.
Published: (2023)
Unbiased Scene Graph Generation from Biased Training
by: Tang, Kaihua, et al.
Published: (2020)
by: Tang, Kaihua, et al.
Published: (2020)
Co-Seg: Mutual Prompt-Guided Collaborative Learning for Tissue and Nuclei Segmentation
by: Xu, Qing, et al.
Published: (2025)
by: Xu, Qing, et al.
Published: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
Co-Seg++: Mutual Prompt-Guided Collaborative Learning for Versatile Medical Segmentation
by: Xu, Qing, et al.
Published: (2025)
by: Xu, Qing, et al.
Published: (2025)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
by: Wu, Shengqiong, et al.
Published: (2025)
by: Wu, Shengqiong, et al.
Published: (2025)
Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
by: Chen, Fuhai, et al.
Published: (2026)
by: Chen, Fuhai, et al.
Published: (2026)
Flow-Guided Diffusion for Video Inpainting
by: Gu, Bohai, et al.
Published: (2023)
by: Gu, Bohai, et al.
Published: (2023)
Joint Generative Modeling of Grounded Scene Graphs and Images via Diffusion Models
by: Xu, Bicheng, et al.
Published: (2024)
by: Xu, Bicheng, et al.
Published: (2024)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
Diffusion Time-step Curriculum for One Image to 3D Generation
by: Yi, Xuanyu, et al.
Published: (2024)
by: Yi, Xuanyu, et al.
Published: (2024)
Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models
by: Zhu, Beier, et al.
Published: (2025)
by: Zhu, Beier, et al.
Published: (2025)
Seg2Any: Open-set Segmentation-Mask-to-Image Generation with Precise Shape and Semantic Control
by: Li, Danfeng, et al.
Published: (2025)
by: Li, Danfeng, et al.
Published: (2025)
EMMA: Your Text-to-Image Diffusion Model Can Secretly Accept Multi-Modal Prompts
by: Han, Yucheng, et al.
Published: (2024)
by: Han, Yucheng, et al.
Published: (2024)
Dual-Stream Collaborative Transformer for Image Captioning
by: Wan, Jun, et al.
Published: (2026)
by: Wan, Jun, et al.
Published: (2026)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
by: Zhao, Qingcheng, et al.
Published: (2025)
by: Zhao, Qingcheng, et al.
Published: (2025)
GeoSceneGraph: Geometric Scene Graph Diffusion Model for Text-guided 3D Indoor Scene Synthesis
by: Ruiz, Antonio, et al.
Published: (2025)
by: Ruiz, Antonio, et al.
Published: (2025)
Graph-Guided Scene Reconstruction from Images with 3D Gaussian Splatting
by: Cheng, Chong, et al.
Published: (2025)
by: Cheng, Chong, et al.
Published: (2025)
SATURN: Autoregressive Image Generation Guided by Scene Graphs
by: Vo, Thanh-Nhan, et al.
Published: (2025)
by: Vo, Thanh-Nhan, et al.
Published: (2025)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
by: Yao, Linli, et al.
Published: (2026)
by: Yao, Linli, et al.
Published: (2026)
High-Fidelity Image Inpainting with Multimodal Guided GAN Inversion
by: Zhang, Libo, et al.
Published: (2025)
by: Zhang, Libo, et al.
Published: (2025)
UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
by: Ni, Shuo, et al.
Published: (2025)
by: Ni, Shuo, et al.
Published: (2025)
Benchmarking and Improving Detail Image Caption
by: Dong, Hongyuan, et al.
Published: (2024)
by: Dong, Hongyuan, et al.
Published: (2024)
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
by: Chu, Sanghyeok, et al.
Published: (2025)
by: Chu, Sanghyeok, et al.
Published: (2025)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
by: Zhang, Tianjiao, et al.
Published: (2025)
by: Zhang, Tianjiao, et al.
Published: (2025)
Scene Graph Disentanglement and Composition for Generalizable Complex Image Generation
by: Wang, Yunnan, et al.
Published: (2024)
by: Wang, Yunnan, et al.
Published: (2024)
MGNet: Learning Correspondences via Multiple Graphs
by: Dai, Luanyuan, et al.
Published: (2024)
by: Dai, Luanyuan, et al.
Published: (2024)
AGIC: Attention-Guided Image Captioning to Improve Caption Relevance
by: Teja, L. D. M. S. Sai, et al.
Published: (2025)
by: Teja, L. D. M. S. Sai, et al.
Published: (2025)
SegDT: A Diffusion Transformer-Based Segmentation Model for Medical Imaging
by: Bekhouche, Salah Eddine, et al.
Published: (2025)
by: Bekhouche, Salah Eddine, et al.
Published: (2025)
SceneTransporter: Optimal Transport-Guided Compositional Latent Diffusion for Single-Image Structured 3D Scene Generation
by: Wang, Ling, et al.
Published: (2026)
by: Wang, Ling, et al.
Published: (2026)
Generalized Visual Relation Detection with Diffusion Models
by: Gao, Kaifeng, et al.
Published: (2025)
by: Gao, Kaifeng, et al.
Published: (2025)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
by: Gao, Kaifeng, et al.
Published: (2024)
by: Gao, Kaifeng, et al.
Published: (2024)
SegAnyPET: Universal Promptable Segmentation from Positron Emission Tomography Images
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Similar Items
-
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
by: Zhang, Xu, et al.
Published: (2026) -
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
by: Zeng, Kang, et al.
Published: (2025) -
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
by: Chen, Jiajun, et al.
Published: (2023) -
Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
by: Wang, Yuxuan, et al.
Published: (2025) -
Image Synthesis with Graph Conditioning: CLIP-Guided Diffusion Models for Scene Graphs
by: Mishra, Rameshwar, et al.
Published: (2024)