WorldAgents: Can Foundation Image Models be Agents for 3D World Models?
Fuente:
arXiv
Saved in:
| Main Authors: | Erkoç, Ziya, Dai, Angela, Nießner, Matthias |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing
by: Ai, Jinxin, et al.
Published: (2026)
by: Ai, Jinxin, et al.
Published: (2026)
PrEditor3D: Fast and Precise 3D Shape Editing
by: Erkoç, Ziya, et al.
Published: (2024)
by: Erkoç, Ziya, et al.
Published: (2024)
MeshPad: Interactive Sketch-Conditioned Artist-Reminiscent Mesh Generation and Editing
by: Li, Haoxuan, et al.
Published: (2025)
by: Li, Haoxuan, et al.
Published: (2025)
Coherent 3D Scene Diffusion From a Single RGB Image
by: Dahnert, Manuel, et al.
Published: (2024)
by: Dahnert, Manuel, et al.
Published: (2024)
World Reconstruction From Inconsistent Views
by: Höllein, Lukas, et al.
Published: (2026)
by: Höllein, Lukas, et al.
Published: (2026)
WorldExplorer: Towards Generating Fully Navigable 3D Scenes
by: Schneider, Manuel-Andreas, et al.
Published: (2025)
by: Schneider, Manuel-Andreas, et al.
Published: (2025)
PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing
by: Oroz, Antonio, et al.
Published: (2025)
by: Oroz, Antonio, et al.
Published: (2025)
Diff3R: Feed-forward 3D Gaussian Splatting with Uncertainty-aware Differentiable Optimization
by: Liu, Yueh-Cheng, et al.
Published: (2026)
by: Liu, Yueh-Cheng, et al.
Published: (2026)
QuickSplat: Fast 3D Surface Reconstruction via Learned Gaussian Initialization
by: Liu, Yueh-Cheng, et al.
Published: (2025)
by: Liu, Yueh-Cheng, et al.
Published: (2025)
LT3SD: Latent Trees for 3D Scene Diffusion
by: Meng, Quan, et al.
Published: (2024)
by: Meng, Quan, et al.
Published: (2024)
Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models
by: Millán, Marc Benedí San, et al.
Published: (2025)
by: Millán, Marc Benedí San, et al.
Published: (2025)
Seen2Scene: Completing Realistic 3D Scenes with Visibility-Guided Flow
by: Meng, Quan, et al.
Published: (2026)
by: Meng, Quan, et al.
Published: (2026)
GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction
by: Schmid, Katharina, et al.
Published: (2026)
by: Schmid, Katharina, et al.
Published: (2026)
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
by: X, Tencent Robotics, et al.
Published: (2026)
by: X, Tencent Robotics, et al.
Published: (2026)
Can Test-Time Scaling Improve World Foundation Model?
by: Cong, Wenyan, et al.
Published: (2025)
by: Cong, Wenyan, et al.
Published: (2025)
DPHMs: Diffusion Parametric Head Models for Depth-based Tracking
by: Tang, Jiapeng, et al.
Published: (2023)
by: Tang, Jiapeng, et al.
Published: (2023)
WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion
by: Schneider, Manuel-Andreas, et al.
Published: (2026)
by: Schneider, Manuel-Andreas, et al.
Published: (2026)
DiffuScene: Denoising Diffusion Models for Generative Indoor Scene Synthesis
by: Tang, Jiapeng, et al.
Published: (2023)
by: Tang, Jiapeng, et al.
Published: (2023)
ViewDiff: 3D-Consistent Image Generation with Text-to-Image Models
by: Höllein, Lukas, et al.
Published: (2024)
by: Höllein, Lukas, et al.
Published: (2024)
Zero-shot Inexact CAD Model Alignment from a Single Image
by: Arsomngern, Pattaramanee, et al.
Published: (2025)
by: Arsomngern, Pattaramanee, et al.
Published: (2025)
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
by: Wu, Haoyu, et al.
Published: (2026)
by: Wu, Haoyu, et al.
Published: (2026)
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
by: Liu, Fangfu, et al.
Published: (2026)
by: Liu, Fangfu, et al.
Published: (2026)
FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision
by: Kirschstein, Tobias, et al.
Published: (2025)
by: Kirschstein, Tobias, et al.
Published: (2025)
HairGS: Hair Strand Reconstruction based on 3D Gaussian Splatting
by: Pan, Yimin, et al.
Published: (2025)
by: Pan, Yimin, et al.
Published: (2025)
DiffusionAvatars: Deferred Diffusion for High-fidelity 3D Head Avatars
by: Kirschstein, Tobias, et al.
Published: (2023)
by: Kirschstein, Tobias, et al.
Published: (2023)
Avat3r: Large Animatable Gaussian Reconstruction Model for High-fidelity 3D Head Avatars
by: Kirschstein, Tobias, et al.
Published: (2025)
by: Kirschstein, Tobias, et al.
Published: (2025)
COMBAT: Conditional World Models for Behavioral Agent Training
by: Agarwal, Anmol, et al.
Published: (2026)
by: Agarwal, Anmol, et al.
Published: (2026)
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
by: Dai, Yixiang, et al.
Published: (2025)
by: Dai, Yixiang, et al.
Published: (2025)
L3DG: Latent 3D Gaussian Diffusion
by: Roessle, Barbara, et al.
Published: (2024)
by: Roessle, Barbara, et al.
Published: (2024)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
by: Chen, Shuang, et al.
Published: (2026)
by: Chen, Shuang, et al.
Published: (2026)
Face Anything: 4D Face Reconstruction from Any Image Sequence
by: Kocasari, Umut, et al.
Published: (2026)
by: Kocasari, Umut, et al.
Published: (2026)
SSR-2D: Semantic 3D Scene Reconstruction from 2D Images
by: Huang, Junwen, et al.
Published: (2023)
by: Huang, Junwen, et al.
Published: (2023)
OpenSU3D: Open World 3D Scene Understanding using Foundation Models
by: Mohiuddin, Rafay, et al.
Published: (2024)
by: Mohiuddin, Rafay, et al.
Published: (2024)
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
by: Zhou, Hanzhang, et al.
Published: (2025)
by: Zhou, Hanzhang, et al.
Published: (2025)
BuildingWorld: A Structured 3D Building Dataset for Urban Foundation Models
by: Huang, Shangfeng, et al.
Published: (2025)
by: Huang, Shangfeng, et al.
Published: (2025)
World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge
by: Son, Moo Hyun, et al.
Published: (2025)
by: Son, Moo Hyun, et al.
Published: (2025)
G3DST: Generalizing 3D Style Transfer with Neural Radiance Fields across Scenes and Styles
by: Meric, Adil, et al.
Published: (2024)
by: Meric, Adil, et al.
Published: (2024)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
by: Aneja, Shivangi, et al.
Published: (2023)
by: Aneja, Shivangi, et al.
Published: (2023)
Robust 3D Gaussian Splatting for Novel View Synthesis in Presence of Distractors
by: Ungermann, Paul, et al.
Published: (2024)
by: Ungermann, Paul, et al.
Published: (2024)
UrbanWorld: An Urban World Model for 3D City Generation
by: Shang, Yu, et al.
Published: (2024)
by: Shang, Yu, et al.
Published: (2024)
Similar Items
-
DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing
by: Ai, Jinxin, et al.
Published: (2026) -
PrEditor3D: Fast and Precise 3D Shape Editing
by: Erkoç, Ziya, et al.
Published: (2024) -
MeshPad: Interactive Sketch-Conditioned Artist-Reminiscent Mesh Generation and Editing
by: Li, Haoxuan, et al.
Published: (2025) -
Coherent 3D Scene Diffusion From a Single RGB Image
by: Dahnert, Manuel, et al.
Published: (2024) -
World Reconstruction From Inconsistent Views
by: Höllein, Lukas, et al.
Published: (2026)