VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Kaixin, Tang, Yiwen, Yang, Yifan, Zhang, Renrui, Zeng, Bohan, Guo, Ziyu, An, Ruichuan, Liu, Zhou, Chen, Qizhi, Qu, Delin, Yoon, Jaehong, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VGGT-SLAM 2.0: Real-time Dense Feed-forward Scene Reconstruction
by: Maggio, Dominic, et al.
Published: (2026)
by: Maggio, Dominic, et al.
Published: (2026)
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
by: Tang, Yiwen, et al.
Published: (2025)
by: Tang, Yiwen, et al.
Published: (2025)
LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Rendering and Control
by: Qu, Delin, et al.
Published: (2024)
by: Qu, Delin, et al.
Published: (2024)
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
by: Yang, Ling, et al.
Published: (2024)
by: Yang, Ling, et al.
Published: (2024)
Review of Feed-forward 3D Reconstruction: From DUSt3R to VGGT
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
by: Shen, Zijun, et al.
Published: (2026)
by: Shen, Zijun, et al.
Published: (2026)
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
by: Lin, Weifeng, et al.
Published: (2025)
by: Lin, Weifeng, et al.
Published: (2025)
Adaptive Classifier-Free Guidance via Dynamic Low-Confidence Masking
by: Li, Pengxiang, et al.
Published: (2025)
by: Li, Pengxiang, et al.
Published: (2025)
Feed-forward Gaussian Registration for Head Avatar Creation and Editing
by: Prinzler, Malte, et al.
Published: (2026)
by: Prinzler, Malte, et al.
Published: (2026)
FreeGaussian: Annotation-free Control of Articulated Objects via 3D Gaussian Splats with Flow Derivatives
by: Chen, Qizhi, et al.
Published: (2024)
by: Chen, Qizhi, et al.
Published: (2024)
WideRange4D: Enabling High-Quality 4D Reconstruction with Wide-Range Movements and Scenes
by: Yang, Ling, et al.
Published: (2025)
by: Yang, Ling, et al.
Published: (2025)
GENIUS: Generative Fluid Intelligence Evaluation Suite
by: An, Ruichuan, et al.
Published: (2026)
by: An, Ruichuan, et al.
Published: (2026)
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
by: Yoon, Jaehong, et al.
Published: (2024)
by: Yoon, Jaehong, et al.
Published: (2024)
Rethinking Residual Distribution in Locate-then-Edit Model Editing
by: Li, Xiaopeng, et al.
Published: (2025)
by: Li, Xiaopeng, et al.
Published: (2025)
VGGT-X: When VGGT Meets Dense Novel View Synthesis
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
Derived logarithmic deformation theory and moduli stacks of derived logarithmic structures
by: Zhang, Ruichuan
Published: (2026)
by: Zhang, Ruichuan
Published: (2026)
Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing
by: Li, Guandong, et al.
Published: (2026)
by: Li, Guandong, et al.
Published: (2026)
TiCard: Deployable EXPLAIN-only Residual Learning for Cardinality Estimation
by: Wang, Qizhi
Published: (2025)
by: Wang, Qizhi
Published: (2025)
PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery
by: Guo, Yijing, et al.
Published: (2026)
by: Guo, Yijing, et al.
Published: (2026)
SceneVGGT: VGGT-based online 3D semantic SLAM for indoor scene understanding and navigation
by: Gelencsér-Horváth, Anna, et al.
Published: (2026)
by: Gelencsér-Horváth, Anna, et al.
Published: (2026)
Exploring the Potential of Encoder-free Architectures in 3D LMMs
by: Tang, Yiwen, et al.
Published: (2025)
by: Tang, Yiwen, et al.
Published: (2025)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
by: Bai, Xuehai, et al.
Published: (2026)
by: Bai, Xuehai, et al.
Published: (2026)
TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation
by: Zhang, Qingwen, et al.
Published: (2026)
by: Zhang, Qingwen, et al.
Published: (2026)
PEARL: Personalized Streaming Video Understanding Model
by: Zheng, Yuanhong, et al.
Published: (2026)
by: Zheng, Yuanhong, et al.
Published: (2026)
HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles
by: Wang, Yifan, et al.
Published: (2026)
by: Wang, Yifan, et al.
Published: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
Language-Assisted 3D Scene Understanding
by: Wu, Yanmin, et al.
Published: (2023)
by: Wu, Yanmin, et al.
Published: (2023)
UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
ImgEdit: A Unified Image Editing Dataset and Benchmark
by: Ye, Yang, et al.
Published: (2025)
by: Ye, Yang, et al.
Published: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
AudioScenic: Audio-Driven Video Scene Editing
by: Shen, Kaixin, et al.
Published: (2024)
by: Shen, Kaixin, et al.
Published: (2024)
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
by: Sun, Xiangyu, et al.
Published: (2026)
by: Sun, Xiangyu, et al.
Published: (2026)
FastVGGT: Training-Free Acceleration of Visual Geometry Transformer
by: Shen, You, et al.
Published: (2025)
by: Shen, You, et al.
Published: (2025)
VGGT-$Ω$
by: Wang, Jianyuan, et al.
Published: (2026)
by: Wang, Jianyuan, et al.
Published: (2026)
KV-Edit: Training-Free Image Editing for Precise Background Preservation
by: Zhu, Tianrui, et al.
Published: (2025)
by: Zhu, Tianrui, et al.
Published: (2025)
DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving
by: He, Zhuolin, et al.
Published: (2026)
by: He, Zhuolin, et al.
Published: (2026)
Learning to Edit: Aligning LLMs with Knowledge Editing
by: Jiang, Yuxin, et al.
Published: (2024)
by: Jiang, Yuxin, et al.
Published: (2024)
AVGGT: Rethinking Global Attention for Accelerating VGGT
by: Sun, Xianbing, et al.
Published: (2025)
by: Sun, Xianbing, et al.
Published: (2025)
SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images
by: Qu, Jinyuan, et al.
Published: (2026)
by: Qu, Jinyuan, et al.
Published: (2026)
Similar Items
-
VGGT-SLAM 2.0: Real-time Dense Feed-forward Scene Reconstruction
by: Maggio, Dominic, et al.
Published: (2026) -
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
by: Tang, Yiwen, et al.
Published: (2025) -
LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Rendering and Control
by: Qu, Delin, et al.
Published: (2024) -
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
by: Yang, Ling, et al.
Published: (2024) -
Review of Feed-forward 3D Reconstruction: From DUSt3R to VGGT
by: Zhang, Wei, et al.
Published: (2025)