MegaScenes: Scene-Level View Synthesis at Scale
Fuente:
arXiv
Saved in:
| Main Authors: | Tung, Joseph, Chou, Gene, Cai, Ruojin, Yang, Guandao, Zhang, Kai, Wetzstein, Gordon, Hariharan, Bharath, Snavely, Noah |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FlashDepth: Real-time Streaming Video Depth Estimation at 2K Resolution
by: Chou, Gene, et al.
Published: (2025)
by: Chou, Gene, et al.
Published: (2025)
C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction
by: Huang, Kuan Wei, et al.
Published: (2025)
by: Huang, Kuan Wei, et al.
Published: (2025)
KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos
by: Chou, Gene, et al.
Published: (2024)
by: Chou, Gene, et al.
Published: (2024)
Learning Feature Descriptors using Camera Pose Supervision
by: Wang, Qianqian, et al.
Published: (2020)
by: Wang, Qianqian, et al.
Published: (2020)
ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild
by: Chen, Hanyu, et al.
Published: (2026)
by: Chen, Hanyu, et al.
Published: (2026)
Doppelgangers++: Improved Visual Disambiguation with Geometric 3D Features
by: Xiangli, Yuanbo, et al.
Published: (2024)
by: Xiangli, Yuanbo, et al.
Published: (2024)
CityRAG: Stepping Into a City via Spatially-Grounded Video Generation
by: Chou, Gene, et al.
Published: (2026)
by: Chou, Gene, et al.
Published: (2026)
Streetscapes: Large-scale Consistent Street View Generation Using Autoregressive Video Diffusion
by: Deng, Boyang, et al.
Published: (2024)
by: Deng, Boyang, et al.
Published: (2024)
Orthogonal Adaptation for Modular Customization of Diffusion Models
by: Po, Ryan, et al.
Published: (2023)
by: Po, Ryan, et al.
Published: (2023)
Long-tail Internet photo reconstruction
by: Li, Yuan, et al.
Published: (2026)
by: Li, Yuan, et al.
Published: (2026)
G3T Up! Gravity Aligned Coordinate Frames Simplify Pointmap Processing
by: Kani, Bharath Raj Nagoor, et al.
Published: (2026)
by: Kani, Bharath Raj Nagoor, et al.
Published: (2026)
ReStyle3D: Scene-Level Appearance Transfer with Semantic Correspondences
by: Zhu, Liyuan, et al.
Published: (2025)
by: Zhu, Liyuan, et al.
Published: (2025)
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
by: Peng, Wenxuan, et al.
Published: (2026)
by: Peng, Wenxuan, et al.
Published: (2026)
Emergent Extreme-View Geometry in 3D Foundation Models
by: Zhang, Yiwen, et al.
Published: (2025)
by: Zhang, Yiwen, et al.
Published: (2025)
Towards Vision-Language-Garment Models for Web Knowledge Garment Understanding and Generation
by: Ackermann, Jan, et al.
Published: (2025)
by: Ackermann, Jan, et al.
Published: (2025)
Self-Calibrating Gaussian Splatting for Large Field of View Reconstruction
by: Deng, Youming, et al.
Published: (2025)
by: Deng, Youming, et al.
Published: (2025)
MoMaps: Semantics-Aware Scene Motion Generation with Motion Maps
by: Lei, Jiahui, et al.
Published: (2025)
by: Lei, Jiahui, et al.
Published: (2025)
ObjectCarver: Semi-automatic segmentation, reconstruction and separation of 3D objects
by: Hassena, Gemmechu, et al.
Published: (2024)
by: Hassena, Gemmechu, et al.
Published: (2024)
Can Generative Video Models Help Pose Estimation?
by: Cai, Ruojin, et al.
Published: (2024)
by: Cai, Ruojin, et al.
Published: (2024)
MegaSynth: Scaling Up 3D Scene Reconstruction with Synthesized Data
by: Jiang, Hanwen, et al.
Published: (2024)
by: Jiang, Hanwen, et al.
Published: (2024)
3DitScene: Editing Any Scene via Language-guided Disentangled Gaussian Splatting
by: Zhang, Qihang, et al.
Published: (2024)
by: Zhang, Qihang, et al.
Published: (2024)
Accurate Differential Operators for Hybrid Neural Fields
by: Chetan, Aditya, et al.
Published: (2023)
by: Chetan, Aditya, et al.
Published: (2023)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
by: Chetan, Aditya, et al.
Published: (2026)
by: Chetan, Aditya, et al.
Published: (2026)
GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D Generation
by: Wu, Tong, et al.
Published: (2024)
by: Wu, Tong, et al.
Published: (2024)
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
by: Sun, Yihong, et al.
Published: (2024)
by: Sun, Yihong, et al.
Published: (2024)
SceneCompleter: Dense 3D Scene Completion for Generative Novel View Synthesis
by: Chen, Weiliang, et al.
Published: (2025)
by: Chen, Weiliang, et al.
Published: (2025)
Robust Symmetry Detection via Riemannian Langevin Dynamics
by: Je, Jihyeon, et al.
Published: (2024)
by: Je, Jihyeon, et al.
Published: (2024)
Visual Chronicles: Using Multimodal LLMs to Analyze Massive Collections of Images
by: Deng, Boyang, et al.
Published: (2025)
by: Deng, Boyang, et al.
Published: (2025)
LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation
by: Yang, Shuai, et al.
Published: (2024)
by: Yang, Shuai, et al.
Published: (2024)
RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
by: Liu, Xiyan, et al.
Published: (2025)
by: Liu, Xiyan, et al.
Published: (2025)
Geometry-Aware Scene Configurations for Novel View Synthesis
by: Kim, Minkwan, et al.
Published: (2025)
by: Kim, Minkwan, et al.
Published: (2025)
MVSplat360: Feed-Forward 360 Scene Synthesis from Sparse Views
by: Chen, Yuedong, et al.
Published: (2024)
by: Chen, Yuedong, et al.
Published: (2024)
MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos
by: Li, Zhengqi, et al.
Published: (2024)
by: Li, Zhengqi, et al.
Published: (2024)
SceneCrafter: Controllable Multi-View Driving Scene Editing
by: Zhu, Zehao, et al.
Published: (2025)
by: Zhu, Zehao, et al.
Published: (2025)
Dynamic Gaussian Marbles for Novel View Synthesis of Casual Monocular Videos
by: Stearns, Colton, et al.
Published: (2024)
by: Stearns, Colton, et al.
Published: (2024)
CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
by: He, Hao, et al.
Published: (2025)
by: He, Hao, et al.
Published: (2025)
Wide-Baseline Relative Camera Pose Estimation with Directional Learning
by: Chen, Kefan, et al.
Published: (2021)
by: Chen, Kefan, et al.
Published: (2021)
SceneGlue: Scene-Aware Transformer for Feature Matching without Scene-Level Annotation
by: Du, Songlin, et al.
Published: (2026)
by: Du, Songlin, et al.
Published: (2026)
Transfer Your Perspective: Controllable 3D Generation from Any Viewpoint in a Driving Scene
by: Pan, Tai-Yu, et al.
Published: (2025)
by: Pan, Tai-Yu, et al.
Published: (2025)
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models
by: Wu, Tong, et al.
Published: (2024)
by: Wu, Tong, et al.
Published: (2024)
Similar Items
-
FlashDepth: Real-time Streaming Video Depth Estimation at 2K Resolution
by: Chou, Gene, et al.
Published: (2025) -
C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction
by: Huang, Kuan Wei, et al.
Published: (2025) -
KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos
by: Chou, Gene, et al.
Published: (2024) -
Learning Feature Descriptors using Camera Pose Supervision
by: Wang, Qianqian, et al.
Published: (2020) -
ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild
by: Chen, Hanyu, et al.
Published: (2026)