Towards Learning a Generalizable 3D Scene Representation from 2D Observations
Fuente:
arXiv
Salvato in:
| Autori principali: | Gromniak, Martin, Habekost, Jan-Gerrit, Kamp, Sebastian, Magg, Sven, Wermter, Stefan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shaken, Not Stirred: A Novel Dataset for Visual Understanding of Glasses in Human-Robot Bartending Tasks
di: Gajdošech, Lukáš, et al.
Pubblicazione: (2025)
di: Gajdošech, Lukáš, et al.
Pubblicazione: (2025)
ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation
di: Chen, Hanzhi, et al.
Pubblicazione: (2025)
di: Chen, Hanzhi, et al.
Pubblicazione: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
OpenSGA: Efficient 3D Scene Graph Alignment in the Open World
di: Chen, Gang, et al.
Pubblicazione: (2026)
di: Chen, Gang, et al.
Pubblicazione: (2026)
OpenLex3D: A Tiered Evaluation Benchmark for Open-Vocabulary 3D Scene Representations
di: Kassab, Christina, et al.
Pubblicazione: (2025)
di: Kassab, Christina, et al.
Pubblicazione: (2025)
Learning Generalizable 3D Manipulation With 10 Demonstrations
di: Ren, Yu, et al.
Pubblicazione: (2024)
di: Ren, Yu, et al.
Pubblicazione: (2024)
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
di: Chen, Xiao, et al.
Pubblicazione: (2025)
di: Chen, Xiao, et al.
Pubblicazione: (2025)
Unifying Scene Representation and Hand-Eye Calibration with 3D Foundation Models
di: Zhi, Weiming, et al.
Pubblicazione: (2024)
di: Zhi, Weiming, et al.
Pubblicazione: (2024)
Lost & Found: Tracking Changes from Egocentric Observations in 3D Dynamic Scene Graphs
di: Behrens, Tjark, et al.
Pubblicazione: (2024)
di: Behrens, Tjark, et al.
Pubblicazione: (2024)
What Is The Best 3D Scene Representation for Robotics? From Geometric to Foundation Models
di: Deng, Tianchen, et al.
Pubblicazione: (2025)
di: Deng, Tianchen, et al.
Pubblicazione: (2025)
OpenOcc: Open Vocabulary 3D Scene Reconstruction via Occupancy Representation
di: Jiang, Haochen, et al.
Pubblicazione: (2024)
di: Jiang, Haochen, et al.
Pubblicazione: (2024)
Preference-Driven Active 3D Scene Representation for Robotic Inspection in Nuclear Decommissioning
di: Meng, Zhen, et al.
Pubblicazione: (2025)
di: Meng, Zhen, et al.
Pubblicazione: (2025)
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
di: Garcia, Ricardo, et al.
Pubblicazione: (2024)
di: Garcia, Ricardo, et al.
Pubblicazione: (2024)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild
di: Rim, Patrick, et al.
Pubblicazione: (2026)
di: Rim, Patrick, et al.
Pubblicazione: (2026)
REACT3D: Recovering Articulations for Interactive Physical 3D Scenes
di: Huang, Zhao, et al.
Pubblicazione: (2025)
di: Huang, Zhao, et al.
Pubblicazione: (2025)
Language-Assisted 3D Scene Understanding
di: Wu, Yanmin, et al.
Pubblicazione: (2023)
di: Wu, Yanmin, et al.
Pubblicazione: (2023)
Anyview: Generalizable Indoor 3D Object Detection with Variable Frames
di: Wu, Zhenyu, et al.
Pubblicazione: (2023)
di: Wu, Zhenyu, et al.
Pubblicazione: (2023)
SG-Reg: Generalizable and Efficient Scene Graph Registration
di: Liu, Chuhao, et al.
Pubblicazione: (2025)
di: Liu, Chuhao, et al.
Pubblicazione: (2025)
MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning
di: Hao, Jinkun, et al.
Pubblicazione: (2025)
di: Hao, Jinkun, et al.
Pubblicazione: (2025)
FetchBot: Learning Generalizable Object Fetching in Cluttered Scenes via Zero-Shot Sim2Real
di: Liu, Weiheng, et al.
Pubblicazione: (2025)
di: Liu, Weiheng, et al.
Pubblicazione: (2025)
Aion: Towards Hierarchical 4D Scene Graphs with Temporal Flow Dynamics
di: Catalano, Iacopo, et al.
Pubblicazione: (2025)
di: Catalano, Iacopo, et al.
Pubblicazione: (2025)
Toward Human-Robot Teaming: Learning Handover Behaviors from 3D Scenes
di: Wu, Yuekun, et al.
Pubblicazione: (2025)
di: Wu, Yuekun, et al.
Pubblicazione: (2025)
SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
WildScenes: A Benchmark for 2D and 3D Semantic Segmentation in Large-scale Natural Environments
di: Vidanapathirana, Kavisha, et al.
Pubblicazione: (2023)
di: Vidanapathirana, Kavisha, et al.
Pubblicazione: (2023)
MoD-SLAM: Monocular Dense Mapping for Unbounded 3D Scene Reconstruction
di: Zhou, Heng, et al.
Pubblicazione: (2024)
di: Zhou, Heng, et al.
Pubblicazione: (2024)
CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving
di: Chen, Runjian, et al.
Pubblicazione: (2022)
di: Chen, Runjian, et al.
Pubblicazione: (2022)
Mimicking-Bench: A Benchmark for Generalizable Humanoid-Scene Interaction Learning via Human Mimicking
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
SLCF-Net: Sequential LiDAR-Camera Fusion for Semantic Scene Completion using a 3D Recurrent U-Net
di: Cao, Helin, et al.
Pubblicazione: (2024)
di: Cao, Helin, et al.
Pubblicazione: (2024)
MonoPlane: Exploiting Monocular Geometric Cues for Generalizable 3D Plane Reconstruction
di: Zhao, Wang, et al.
Pubblicazione: (2024)
di: Zhao, Wang, et al.
Pubblicazione: (2024)
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding
di: Ge, Luzhou, et al.
Pubblicazione: (2026)
di: Ge, Luzhou, et al.
Pubblicazione: (2026)
3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2024)
Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning
di: Liang, Qiwei, et al.
Pubblicazione: (2025)
di: Liang, Qiwei, et al.
Pubblicazione: (2025)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
di: Peng, Daojie, et al.
Pubblicazione: (2026)
di: Peng, Daojie, et al.
Pubblicazione: (2026)
KeySG: Hierarchical Keyframe-Based 3D Scene Graphs
di: Werby, Abdelrhman, et al.
Pubblicazione: (2025)
di: Werby, Abdelrhman, et al.
Pubblicazione: (2025)
SGFormer: Satellite-Ground Fusion for 3D Semantic Scene Completion
di: Guo, Xiyue, et al.
Pubblicazione: (2025)
di: Guo, Xiyue, et al.
Pubblicazione: (2025)
Pandora: Articulated 3D Scene Graphs from Egocentric Vision
di: Yu, Alan, et al.
Pubblicazione: (2026)
di: Yu, Alan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Shaken, Not Stirred: A Novel Dataset for Visual Understanding of Glasses in Human-Robot Bartending Tasks
di: Gajdošech, Lukáš, et al.
Pubblicazione: (2025) -
ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations
di: Li, Zheng, et al.
Pubblicazione: (2025) -
VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation
di: Chen, Hanzhi, et al.
Pubblicazione: (2025) -
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024) -
OpenSGA: Efficient 3D Scene Graph Alignment in the Open World
di: Chen, Gang, et al.
Pubblicazione: (2026)