Compositional Scene Understanding through Inverse Generative Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yanbo, Dauwels, Justin, Du, Yilun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Slot-VAE: Object-Centric Scene Generation with Slot Attention
par: Wang, Yanbo, et autres
Publié: (2023)
par: Wang, Yanbo, et autres
Publié: (2023)
Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video
par: Benschop, Pascal, et autres
Publié: (2026)
par: Benschop, Pascal, et autres
Publié: (2026)
Compositional Image Decomposition with Diffusion Models
par: Su, Jocelin, et autres
Publié: (2024)
par: Su, Jocelin, et autres
Publié: (2024)
Evaluating Compositional Scene Understanding in Multimodal Generative Models
par: Fu, Shuhao, et autres
Publié: (2025)
par: Fu, Shuhao, et autres
Publié: (2025)
Evaluation of Vision-LLMs in Surveillance Video
par: Benschop, Pascal, et autres
Publié: (2025)
par: Benschop, Pascal, et autres
Publié: (2025)
Compositional Generative Modeling: A Single Model is Not All You Need
par: Du, Yilun, et autres
Publié: (2024)
par: Du, Yilun, et autres
Publié: (2024)
Structured Generative Models for Scene Understanding
par: Williams, Christopher K. I.
Publié: (2023)
par: Williams, Christopher K. I.
Publié: (2023)
Long-Text-to-Image Generation via Compositional Prompt Decomposition
par: Huang, Jen-Yuan, et autres
Publié: (2026)
par: Huang, Jen-Yuan, et autres
Publié: (2026)
Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
par: Wang, Runqian, et autres
Publié: (2025)
par: Wang, Runqian, et autres
Publié: (2025)
IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
par: Liu, Parker, et autres
Publié: (2025)
par: Liu, Parker, et autres
Publié: (2025)
ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes
par: Deng, Tianchen, et autres
Publié: (2023)
par: Deng, Tianchen, et autres
Publié: (2023)
Adaptive Visual Scene Understanding: Incremental Scene Graph Generation
par: Khandelwal, Naitik, et autres
Publié: (2023)
par: Khandelwal, Naitik, et autres
Publié: (2023)
Inverse Scene Text Removal
par: Yoshimatsu, Takumi, et autres
Publié: (2025)
par: Yoshimatsu, Takumi, et autres
Publié: (2025)
Dynamic Scene Understanding through Object-Centric Voxelization and Neural Rendering
par: Zhao, Yanpeng, et autres
Publié: (2024)
par: Zhao, Yanpeng, et autres
Publié: (2024)
Compositional Feature Augmentation for Unbiased Scene Graph Generation
par: Li, Lin, et autres
Publié: (2023)
par: Li, Lin, et autres
Publié: (2023)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
par: Huang, Haifeng, et autres
Publié: (2023)
par: Huang, Haifeng, et autres
Publié: (2023)
Generative Learning of Differentiable Object Models for Compositional Interpretation of Complex Scenes
par: Nowinowski, Antoni, et autres
Publié: (2025)
par: Nowinowski, Antoni, et autres
Publié: (2025)
Grounding Video Models to Actions through Goal Conditioned Exploration
par: Luo, Yunhao, et autres
Publié: (2024)
par: Luo, Yunhao, et autres
Publié: (2024)
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Du, Henghui, et autres
Publié: (2025)
par: Du, Henghui, et autres
Publié: (2025)
Scene Graph Disentanglement and Composition for Generalizable Complex Image Generation
par: Wang, Yunnan, et autres
Publié: (2024)
par: Wang, Yunnan, et autres
Publié: (2024)
SceneGPT: A Language Model for 3D Scene Understanding
par: Chandhok, Shivam
Publié: (2024)
par: Chandhok, Shivam
Publié: (2024)
GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding
par: Wang, Xihan, et autres
Publié: (2025)
par: Wang, Xihan, et autres
Publié: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
Scene-Agnostic Traversability Labeling and Estimation via a Multimodal Self-supervised Framework
par: Fang, Zipeng, et autres
Publié: (2025)
par: Fang, Zipeng, et autres
Publié: (2025)
SceneTransporter: Optimal Transport-Guided Compositional Latent Diffusion for Single-Image Structured 3D Scene Generation
par: Wang, Ling, et autres
Publié: (2026)
par: Wang, Ling, et autres
Publié: (2026)
Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
par: Huang, Haifeng, et autres
Publié: (2026)
par: Huang, Haifeng, et autres
Publié: (2026)
SceneLinker: Compositional 3D Scene Generation via Semantic Scene Graph from RGB Sequences
par: Kim, Seok-Young, et autres
Publié: (2026)
par: Kim, Seok-Young, et autres
Publié: (2026)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
par: Xu, Wei, et autres
Publié: (2025)
par: Xu, Wei, et autres
Publié: (2025)
Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
Predicting Reaction Time to Comprehend Scenes with Foveated Scene Understanding Maps
par: Wen, Ziqi, et autres
Publié: (2025)
par: Wen, Ziqi, et autres
Publié: (2025)
Generative Modeling via Drifting
par: Deng, Mingyang, et autres
Publié: (2026)
par: Deng, Mingyang, et autres
Publié: (2026)
Comp4D: LLM-Guided Compositional 4D Scene Generation
par: Xu, Dejia, et autres
Publié: (2024)
par: Xu, Dejia, et autres
Publié: (2024)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
par: Chen, Seng Nam, et autres
Publié: (2026)
par: Chen, Seng Nam, et autres
Publié: (2026)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
par: Zhou, Xin, et autres
Publié: (2026)
par: Zhou, Xin, et autres
Publié: (2026)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
par: Yang, Yuncong, et autres
Publié: (2024)
par: Yang, Yuncong, et autres
Publié: (2024)
RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
par: Liu, Xiyan, et autres
Publié: (2025)
par: Liu, Xiyan, et autres
Publié: (2025)
Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding
par: Jiang, Yuheng, et autres
Publié: (2026)
par: Jiang, Yuheng, et autres
Publié: (2026)
InvRGB+L: Inverse Rendering of Complex Scenes with Unified Color and LiDAR Reflectance Modeling
par: Chen, Xiaoxue, et autres
Publié: (2025)
par: Chen, Xiaoxue, et autres
Publié: (2025)
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
par: Deng, Tianchen, et autres
Publié: (2025)
par: Deng, Tianchen, et autres
Publié: (2025)
Documents similaires
-
Slot-VAE: Object-Centric Scene Generation with Slot Attention
par: Wang, Yanbo, et autres
Publié: (2023) -
Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video
par: Benschop, Pascal, et autres
Publié: (2026) -
Compositional Image Decomposition with Diffusion Models
par: Su, Jocelin, et autres
Publié: (2024) -
Evaluating Compositional Scene Understanding in Multimodal Generative Models
par: Fu, Shuhao, et autres
Publié: (2025) -
Evaluation of Vision-LLMs in Surveillance Video
par: Benschop, Pascal, et autres
Publié: (2025)