Masked Scene Modeling: Narrowing the Gap Between Supervised and Self-Supervised Learning in 3D Scene Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Hermosilla, Pedro, Stippel, Christian, Sick, Leon |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
D$^3$epth: Self-Supervised Depth Estimation with Dynamic Mask in Dynamic Scenes
by: Chen, Siyu, et al.
Published: (2024)
by: Chen, Siyu, et al.
Published: (2024)
Marching Neurons: Accurate Surface Extraction for Neural Implicit Shapes
by: Stippel, Christian, et al.
Published: (2025)
by: Stippel, Christian, et al.
Published: (2025)
Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning
by: Wei, Yibing, et al.
Published: (2024)
by: Wei, Yibing, et al.
Published: (2024)
VoteFlow: Enforcing Local Rigidity in Self-Supervised Scene Flow
by: Lin, Yancong, et al.
Published: (2025)
by: Lin, Yancong, et al.
Published: (2025)
Self-Supervised Multi-Frame Neural Scene Flow
by: Liu, Dongrui, et al.
Published: (2024)
by: Liu, Dongrui, et al.
Published: (2024)
Leveraging Self-Supervised Learning for Scene Classification in Child Sexual Abuse Imagery
by: Valois, Pedro H. V., et al.
Published: (2024)
by: Valois, Pedro H. V., et al.
Published: (2024)
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
by: Jeon, Yerim, et al.
Published: (2025)
by: Jeon, Yerim, et al.
Published: (2025)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
Attention-Guided Masked Autoencoders For Learning Image Representations
by: Sick, Leon, et al.
Published: (2024)
by: Sick, Leon, et al.
Published: (2024)
Mask & Match: Learning to Recognize Handwritten Math with Self-Supervised Attention
by: Mitra, Shree, et al.
Published: (2025)
by: Mitra, Shree, et al.
Published: (2025)
Hardness-Aware Scene Synthesis for Semi-Supervised 3D Object Detection
by: Zeng, Shuai, et al.
Published: (2024)
by: Zeng, Shuai, et al.
Published: (2024)
2D-3D Interlaced Transformer for Point Cloud Segmentation with Scene-Level Supervision
by: Yang, Cheng-Kun, et al.
Published: (2023)
by: Yang, Cheng-Kun, et al.
Published: (2023)
SSEditor: Controllable Mask-to-Scene Generation with Diffusion Model
by: Zheng, Haowen, et al.
Published: (2024)
by: Zheng, Haowen, et al.
Published: (2024)
S3PT: Scene Semantics and Structure Guided Clustering to Boost Self-Supervised Pre-Training for Autonomous Driving
by: Wozniak, Maciej K., et al.
Published: (2024)
by: Wozniak, Maciej K., et al.
Published: (2024)
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
by: Fu, Rao, et al.
Published: (2024)
by: Fu, Rao, et al.
Published: (2024)
HexPlane Representation for 3D Semantic Scene Understanding
by: Chen, Zeren, et al.
Published: (2025)
by: Chen, Zeren, et al.
Published: (2025)
BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model
by: Han, Yuci, et al.
Published: (2026)
by: Han, Yuci, et al.
Published: (2026)
Fusing Forces: Deep-Human-Guided Refinement of Segmentation Masks
by: Sterzinger, Rafael, et al.
Published: (2024)
by: Sterzinger, Rafael, et al.
Published: (2024)
FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
by: Zuo, Xingxing, et al.
Published: (2024)
by: Zuo, Xingxing, et al.
Published: (2024)
Transfer or Self-Supervised? Bridging the Performance Gap in Medical Imaging
by: Zhao, Zehui, et al.
Published: (2024)
by: Zhao, Zehui, et al.
Published: (2024)
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
by: Chen, Yixin, et al.
Published: (2026)
by: Chen, Yixin, et al.
Published: (2026)
3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation
by: Zhang, Frank, et al.
Published: (2024)
by: Zhang, Frank, et al.
Published: (2024)
RenderWorld: World Model with Self-Supervised 3D Label
by: Yan, Ziyang, et al.
Published: (2024)
by: Yan, Ziyang, et al.
Published: (2024)
GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision
by: Zhang, Zihui, et al.
Published: (2025)
by: Zhang, Zihui, et al.
Published: (2025)
Closing the Gap in Human Behavior Analysis: A Pipeline for Synthesizing Trimodal Data
by: Stippel, Christian, et al.
Published: (2024)
by: Stippel, Christian, et al.
Published: (2024)
Unified Semantic Transformer for 3D Scene Understanding
by: Koch, Sebastian, et al.
Published: (2025)
by: Koch, Sebastian, et al.
Published: (2025)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
by: Zeng, Nianbo, et al.
Published: (2025)
by: Zeng, Nianbo, et al.
Published: (2025)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
by: Xu, Yifan, et al.
Published: (2025)
by: Xu, Yifan, et al.
Published: (2025)
MaskAnyNet: Rethinking Masked Image Regions as Valuable Information in Supervised Learning
by: Hong, Jingshan, et al.
Published: (2025)
by: Hong, Jingshan, et al.
Published: (2025)
DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation
by: Wang, Zirui, et al.
Published: (2025)
by: Wang, Zirui, et al.
Published: (2025)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
by: Linghu, Xiongkun, et al.
Published: (2026)
by: Linghu, Xiongkun, et al.
Published: (2026)
Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
by: Feng, Tuo, et al.
Published: (2024)
by: Feng, Tuo, et al.
Published: (2024)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
by: Liu, Yuhong, et al.
Published: (2025)
by: Liu, Yuhong, et al.
Published: (2025)
SelfSwapper: Self-Supervised Face Swapping via Shape Agnostic Masked AutoEncoder
by: Lee, Jaeseong, et al.
Published: (2024)
by: Lee, Jaeseong, et al.
Published: (2024)
EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision
by: Chen, Jiahao, et al.
Published: (2026)
by: Chen, Jiahao, et al.
Published: (2026)
RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding
by: Yang, Jihan, et al.
Published: (2023)
by: Yang, Jihan, et al.
Published: (2023)
Scene Splatter: Momentum 3D Scene Generation from Single Image with Video Diffusion Model
by: Zhang, Shengjun, et al.
Published: (2025)
by: Zhang, Shengjun, et al.
Published: (2025)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
by: Linghu, Xiongkun, et al.
Published: (2025)
by: Linghu, Xiongkun, et al.
Published: (2025)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
by: Jia, Baoxiong, et al.
Published: (2024)
by: Jia, Baoxiong, et al.
Published: (2024)
Evaluating Compositional Scene Understanding in Multimodal Generative Models
by: Fu, Shuhao, et al.
Published: (2025)
by: Fu, Shuhao, et al.
Published: (2025)
Similar Items
-
D$^3$epth: Self-Supervised Depth Estimation with Dynamic Mask in Dynamic Scenes
by: Chen, Siyu, et al.
Published: (2024) -
Marching Neurons: Accurate Surface Extraction for Neural Implicit Shapes
by: Stippel, Christian, et al.
Published: (2025) -
Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning
by: Wei, Yibing, et al.
Published: (2024) -
VoteFlow: Enforcing Local Rigidity in Self-Supervised Scene Flow
by: Lin, Yancong, et al.
Published: (2025) -
Self-Supervised Multi-Frame Neural Scene Flow
by: Liu, Dongrui, et al.
Published: (2024)