The Scene Language: Representing Scenes with Programs, Words, and Embeddings
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yunzhi, Li, Zizhang, Zhou, Matt, Wu, Shangzhe, Wu, Jiajun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Product of Experts for Visual Generation
by: Zhang, Yunzhi, et al.
Published: (2025)
by: Zhang, Yunzhi, et al.
Published: (2025)
WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions
by: Li, Zizhang, et al.
Published: (2025)
by: Li, Zizhang, et al.
Published: (2025)
From Programs to Poses: Factored Real-World Scene Generation via Learned Program Libraries
by: Hsu, Joy, et al.
Published: (2025)
by: Hsu, Joy, et al.
Published: (2025)
Language-Informed Visual Concept Learning
by: Lee, Sharon, et al.
Published: (2023)
by: Lee, Sharon, et al.
Published: (2023)
General Scene Adaptation for Vision-and-Language Navigation
by: Hong, Haodong, et al.
Published: (2025)
by: Hong, Haodong, et al.
Published: (2025)
Seeing a Rose in Five Thousand Ways
by: Zhang, Yunzhi, et al.
Published: (2022)
by: Zhang, Yunzhi, et al.
Published: (2022)
PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation
by: Zhan, Jiahao, et al.
Published: (2026)
by: Zhan, Jiahao, et al.
Published: (2026)
Ctrl-VI: Controllable Video Synthesis via Variational Inference
by: Duan, Haoyi, et al.
Published: (2025)
by: Duan, Haoyi, et al.
Published: (2025)
SceneLLM: Implicit Language Reasoning in LLM for Dynamic Scene Graph Generation
by: Zhang, Hang, et al.
Published: (2024)
by: Zhang, Hang, et al.
Published: (2024)
SceneGen: Single-Image 3D Scene Generation in One Feedforward Pass
by: Meng, Yanxu, et al.
Published: (2025)
by: Meng, Yanxu, et al.
Published: (2025)
Learning the 3D Fauna of the Web
by: Li, Zizhang, et al.
Published: (2024)
by: Li, Zizhang, et al.
Published: (2024)
SceneX: Procedural Controllable Large-scale Scene Generation
by: Zhou, Mengqi, et al.
Published: (2024)
by: Zhou, Mengqi, et al.
Published: (2024)
MMOne: Representing Multiple Modalities in One Scene
by: Gu, Zhifeng, et al.
Published: (2025)
by: Gu, Zhifeng, et al.
Published: (2025)
Planning with the Views via Scene Self-Exploration
by: Wang, Kangrui, et al.
Published: (2026)
by: Wang, Kangrui, et al.
Published: (2026)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
by: Alzayer, Hadi, et al.
Published: (2025)
by: Alzayer, Hadi, et al.
Published: (2025)
RealWonder: Real-Time Physical Action-Conditioned Video Generation
by: Liu, Wei, et al.
Published: (2026)
by: Liu, Wei, et al.
Published: (2026)
GA-GS: Generation-Assisted Gaussian Splatting for Static Scene Reconstruction
by: Shen, Yedong, et al.
Published: (2026)
by: Shen, Yedong, et al.
Published: (2026)
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
by: Gu, Zeqi, et al.
Published: (2025)
by: Gu, Zeqi, et al.
Published: (2025)
Birth and Death of a Rose
by: Geng, Chen, et al.
Published: (2024)
by: Geng, Chen, et al.
Published: (2024)
FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
by: Zuo, Xingxing, et al.
Published: (2024)
by: Zuo, Xingxing, et al.
Published: (2024)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
by: Xu, Yifan, et al.
Published: (2025)
by: Xu, Yifan, et al.
Published: (2025)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
by: Wu, Rining, et al.
Published: (2024)
by: Wu, Rining, et al.
Published: (2024)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
by: Shi, Xinrui, et al.
Published: (2026)
by: Shi, Xinrui, et al.
Published: (2026)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
by: Cao, Yue, et al.
Published: (2024)
by: Cao, Yue, et al.
Published: (2024)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
by: Zhang, Jiwen, et al.
Published: (2026)
by: Zhang, Jiwen, et al.
Published: (2026)
Ponymation: Learning Articulated 3D Animal Motions from Unlabeled Online Videos
by: Sun, Keqiang, et al.
Published: (2023)
by: Sun, Keqiang, et al.
Published: (2023)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
by: Xiao, Zhendong, et al.
Published: (2025)
by: Xiao, Zhendong, et al.
Published: (2025)
HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation
by: Chen, Zini, et al.
Published: (2026)
by: Chen, Zini, et al.
Published: (2026)
Scene Splatter: Momentum 3D Scene Generation from Single Image with Video Diffusion Model
by: Zhang, Shengjun, et al.
Published: (2025)
by: Zhang, Shengjun, et al.
Published: (2025)
FurniScene: A Large-scale 3D Room Dataset with Intricate Furnishing Scenes
by: Zhang, Genghao, et al.
Published: (2024)
by: Zhang, Genghao, et al.
Published: (2024)
3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation
by: Zhang, Frank, et al.
Published: (2024)
by: Zhang, Frank, et al.
Published: (2024)
SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
by: Shi, Yukai, et al.
Published: (2025)
by: Shi, Yukai, et al.
Published: (2025)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
by: Wang, Yaoting, et al.
Published: (2024)
by: Wang, Yaoting, et al.
Published: (2024)
SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
by: Cho, Jungbin, et al.
Published: (2025)
by: Cho, Jungbin, et al.
Published: (2025)
DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian Splatting
by: Zhou, Shijie, et al.
Published: (2024)
by: Zhou, Shijie, et al.
Published: (2024)
Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
by: Chen, Fuhai, et al.
Published: (2026)
by: Chen, Fuhai, et al.
Published: (2026)
Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow
by: Qian, Shenhan, et al.
Published: (2026)
by: Qian, Shenhan, et al.
Published: (2026)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
by: Zeng, Nianbo, et al.
Published: (2025)
by: Zeng, Nianbo, et al.
Published: (2025)
Fine-Grained Scene Graph Generation via Sample-Level Bias Prediction
by: Li, Yansheng, et al.
Published: (2024)
by: Li, Yansheng, et al.
Published: (2024)
Similar Items
-
Product of Experts for Visual Generation
by: Zhang, Yunzhi, et al.
Published: (2025) -
WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions
by: Li, Zizhang, et al.
Published: (2025) -
From Programs to Poses: Factored Real-World Scene Generation via Learned Program Libraries
by: Hsu, Joy, et al.
Published: (2025) -
Language-Informed Visual Concept Learning
by: Lee, Sharon, et al.
Published: (2023) -
General Scene Adaptation for Vision-and-Language Navigation
by: Hong, Haodong, et al.
Published: (2025)