Supplementing Missing Visions via Dialog for Scene Graph Generations
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Zhenghao, Zhu, Ye, Zhu, Xiaoguang, Shang, Yuzhang, Yan, Yan |
|---|---|
| Format: | Preprint |
| Published: |
2022
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dataset Quantization with Active Learning based Adaptive Sampling
by: Zhao, Zhenghao, et al.
Published: (2024)
by: Zhao, Zhenghao, et al.
Published: (2024)
Efficient Multimodal Dataset Distillation via Generative Models
by: Zhao, Zhenghao, et al.
Published: (2025)
by: Zhao, Zhenghao, et al.
Published: (2025)
Distill Video Datasets into Images
by: Zhao, Zhenghao, et al.
Published: (2025)
by: Zhao, Zhenghao, et al.
Published: (2025)
CaO$_2$: Rectifying Inconsistencies in Diffusion-Based Dataset Distillation
by: Wang, Haoxuan, et al.
Published: (2025)
by: Wang, Haoxuan, et al.
Published: (2025)
FBPT: A Fully Binary Point Transformer
by: Hou, Zhixing, et al.
Published: (2024)
by: Hou, Zhixing, et al.
Published: (2024)
Efficient Multitask Dense Predictor via Binarization
by: Shang, Yuzhang, et al.
Published: (2024)
by: Shang, Yuzhang, et al.
Published: (2024)
QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning
by: Wang, Haoxuan, et al.
Published: (2024)
by: Wang, Haoxuan, et al.
Published: (2024)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
by: Li, Kunyang, et al.
Published: (2026)
by: Li, Kunyang, et al.
Published: (2026)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
by: Wu, Junyi, et al.
Published: (2024)
by: Wu, Junyi, et al.
Published: (2024)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
by: Kang, Weitai, et al.
Published: (2024)
by: Kang, Weitai, et al.
Published: (2024)
Vision+X: A Survey on Multimodal Learning in the Light of Data
by: Zhu, Ye, et al.
Published: (2022)
by: Zhu, Ye, et al.
Published: (2022)
SimGen: Simulator-conditioned Driving Scene Generation
by: Zhou, Yunsong, et al.
Published: (2024)
by: Zhou, Yunsong, et al.
Published: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
by: Wang, Weizhen, et al.
Published: (2025)
by: Wang, Weizhen, et al.
Published: (2025)
Scene Graph Aided Radiology Report Generation
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
freePruner: A Training-free Approach for Large Multimodal Model Acceleration
by: Xu, Bingxin, et al.
Published: (2024)
by: Xu, Bingxin, et al.
Published: (2024)
Online Multi-spectral Neuron Tracing
by: Duan, Bin, et al.
Published: (2024)
by: Duan, Bin, et al.
Published: (2024)
Joint Generative Modeling of Grounded Scene Graphs and Images via Diffusion Models
by: Xu, Bicheng, et al.
Published: (2024)
by: Xu, Bicheng, et al.
Published: (2024)
3D Scene Graph Guided Vision-Language Pre-training
by: Liu, Hao, et al.
Published: (2024)
by: Liu, Hao, et al.
Published: (2024)
Salient Temporal Encoding for Dynamic Scene Graph Generation
by: Zhu, Zhihao
Published: (2025)
by: Zhu, Zhihao
Published: (2025)
FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs
by: Yan, Bowen, et al.
Published: (2024)
by: Yan, Bowen, et al.
Published: (2024)
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
by: Makarov, Vladislav, et al.
Published: (2026)
by: Makarov, Vladislav, et al.
Published: (2026)
CommonScenes: Generating Commonsense 3D Indoor Scenes with Scene Graph Diffusion
by: Zhai, Guangyao, et al.
Published: (2023)
by: Zhai, Guangyao, et al.
Published: (2023)
OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal Models
by: Zhou, Zijian, et al.
Published: (2024)
by: Zhou, Zijian, et al.
Published: (2024)
Imaginarium: Vision-guided High-Quality 3D Scene Layout Generation
by: Zhu, Xiaoming, et al.
Published: (2025)
by: Zhu, Xiaoming, et al.
Published: (2025)
VGDFR: Diffusion-based Video Generation with Dynamic Latent Frame Rate
by: Yuan, Zhihang, et al.
Published: (2025)
by: Yuan, Zhihang, et al.
Published: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
by: Shang, Yuzhang, et al.
Published: (2024)
by: Shang, Yuzhang, et al.
Published: (2024)
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
by: Zhou, Zijian, et al.
Published: (2023)
by: Zhou, Zijian, et al.
Published: (2023)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
by: Zhu, Chen, et al.
Published: (2025)
by: Zhu, Chen, et al.
Published: (2025)
A Unified Image-Dense Annotation Generation Model for Underwater Scenes
by: Lin, Hongkai, et al.
Published: (2025)
by: Lin, Hongkai, et al.
Published: (2025)
Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation
by: Gui, Xingtai, et al.
Published: (2026)
by: Gui, Xingtai, et al.
Published: (2026)
SceneStreamer: Continuous Scenario Generation as Next Token Group Prediction
by: Peng, Zhenghao, et al.
Published: (2025)
by: Peng, Zhenghao, et al.
Published: (2025)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
by: Liu, Yuanyuan, et al.
Published: (2025)
by: Liu, Yuanyuan, et al.
Published: (2025)
Controllable 3D Outdoor Scene Generation via Scene Graphs
by: Liu, Yuheng, et al.
Published: (2025)
by: Liu, Yuheng, et al.
Published: (2025)
From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models
by: Li, Rongjie, et al.
Published: (2024)
by: Li, Rongjie, et al.
Published: (2024)
Informative Scene Graph Generation via Debiasing
by: Gao, Lianli, et al.
Published: (2023)
by: Gao, Lianli, et al.
Published: (2023)
Alleviating Class Imbalance in Semi-supervised Multi-organ Segmentation via Balanced Subclass Regularization
by: Feng, Zhenghao, et al.
Published: (2024)
by: Feng, Zhenghao, et al.
Published: (2024)
Multiview Scene Graph
by: Zhang, Juexiao, et al.
Published: (2024)
by: Zhang, Juexiao, et al.
Published: (2024)
Robust Embodied Perception in Dynamic Environments via Disentangled Weight Fusion
by: Guo, Juncen, et al.
Published: (2026)
by: Guo, Juncen, et al.
Published: (2026)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
by: Qi, Zhangyang, et al.
Published: (2025)
by: Qi, Zhangyang, et al.
Published: (2025)
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
by: Yuan, Zhihang, et al.
Published: (2024)
by: Yuan, Zhihang, et al.
Published: (2024)
Similar Items
-
Dataset Quantization with Active Learning based Adaptive Sampling
by: Zhao, Zhenghao, et al.
Published: (2024) -
Efficient Multimodal Dataset Distillation via Generative Models
by: Zhao, Zhenghao, et al.
Published: (2025) -
Distill Video Datasets into Images
by: Zhao, Zhenghao, et al.
Published: (2025) -
CaO$_2$: Rectifying Inconsistencies in Diffusion-Based Dataset Distillation
by: Wang, Haoxuan, et al.
Published: (2025) -
FBPT: A Fully Binary Point Transformer
by: Hou, Zhixing, et al.
Published: (2024)