RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Jihan, Ding, Runyu, Deng, Weipeng, Wang, Zhe, Qi, Xiaojuan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can 3D Vision-Language Models Truly Understand Natural Language?
par: Deng, Weipeng, et autres
Publié: (2024)
par: Deng, Weipeng, et autres
Publié: (2024)
V-IRL: Grounding Virtual Intelligence in Real Life
par: Yang, Jihan, et autres
Publié: (2024)
par: Yang, Jihan, et autres
Publié: (2024)
UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision
par: Wang, Yuru, et autres
Publié: (2024)
par: Wang, Yuru, et autres
Publié: (2024)
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
OpenSU3D: Open World 3D Scene Understanding using Foundation Models
par: Mohiuddin, Rafay, et autres
Publié: (2024)
par: Mohiuddin, Rafay, et autres
Publié: (2024)
AVS-Net: Point Sampling with Adaptive Voxel Size for 3D Scene Understanding
par: Yang, Hongcheng, et autres
Publié: (2024)
par: Yang, Hongcheng, et autres
Publié: (2024)
Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning
par: Yu, Fei, et autres
Publié: (2025)
par: Yu, Fei, et autres
Publié: (2025)
Total-Decom: Decomposed 3D Scene Reconstruction with Minimal Interaction
par: Lyu, Xiaoyang, et autres
Publié: (2024)
par: Lyu, Xiaoyang, et autres
Publié: (2024)
Scene Understanding Enabled Semantic Communication with Open Channel Coding
par: Xiang, Zhe, et autres
Publié: (2025)
par: Xiang, Zhe, et autres
Publié: (2025)
GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding
par: Wang, Xihan, et autres
Publié: (2025)
par: Wang, Xihan, et autres
Publié: (2025)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
POMA-3D: The Point Map Way to 3D Scene Understanding
par: Mao, Ye, et autres
Publié: (2025)
par: Mao, Ye, et autres
Publié: (2025)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
par: Yang, Yu-Qi, et autres
Publié: (2024)
par: Yang, Yu-Qi, et autres
Publié: (2024)
Contrastive Language-Colored Pointmap Pretraining for Unified 3D Scene Understanding
par: Mao, Ye, et autres
Publié: (2026)
par: Mao, Ye, et autres
Publié: (2026)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
par: Yang, Bin, et autres
Publié: (2026)
par: Yang, Bin, et autres
Publié: (2026)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
SceneGPT: A Language Model for 3D Scene Understanding
par: Chandhok, Shivam
Publié: (2024)
par: Chandhok, Shivam
Publié: (2024)
QDM: Quadtree-Based Region-Adaptive Sparse Diffusion Models for Efficient Image Super-Resolution
par: Yang, Donglin, et autres
Publié: (2025)
par: Yang, Donglin, et autres
Publié: (2025)
RegionGPT: Towards Region Understanding Vision Language Model
par: Guo, Qiushan, et autres
Publié: (2024)
par: Guo, Qiushan, et autres
Publié: (2024)
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
par: Zhao, Youjun, et autres
Publié: (2024)
par: Zhao, Youjun, et autres
Publié: (2024)
Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding
par: Li, Ruihuang, et autres
Publié: (2024)
par: Li, Ruihuang, et autres
Publié: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
par: Tai, Hanchen, et autres
Publié: (2024)
par: Tai, Hanchen, et autres
Publié: (2024)
Unified 3D Scene Understanding Through Physical World Modeling
par: Lee, Wanhee, et autres
Publié: (2026)
par: Lee, Wanhee, et autres
Publié: (2026)
Parameter-efficient Prompt Learning for 3D Point Cloud Understanding
par: Sun, Hongyu, et autres
Publié: (2024)
par: Sun, Hongyu, et autres
Publié: (2024)
EgoSplat: Open-Vocabulary Egocentric Scene Understanding with Language Embedded 3D Gaussian Splatting
par: Li, Di, et autres
Publié: (2025)
par: Li, Di, et autres
Publié: (2025)
OpenSGA: Efficient 3D Scene Graph Alignment in the Open World
par: Chen, Gang, et autres
Publié: (2026)
par: Chen, Gang, et autres
Publié: (2026)
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
par: Deng, Tianchen, et autres
Publié: (2025)
par: Deng, Tianchen, et autres
Publié: (2025)
Language-Assisted 3D Scene Understanding
par: Wu, Yanmin, et autres
Publié: (2023)
par: Wu, Yanmin, et autres
Publié: (2023)
PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding
par: Liu, Siyuan, et autres
Publié: (2026)
par: Liu, Siyuan, et autres
Publié: (2026)
OpenDlign: Open-World Point Cloud Understanding with Depth-Aligned Images
par: Mao, Ye, et autres
Publié: (2024)
par: Mao, Ye, et autres
Publié: (2024)
OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
par: Wu, Yanmin, et autres
Publié: (2024)
par: Wu, Yanmin, et autres
Publié: (2024)
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
par: Zhou, Xin, et autres
Publié: (2025)
par: Zhou, Xin, et autres
Publié: (2025)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
par: Chu, Hengshuo, et autres
Publié: (2025)
par: Chu, Hengshuo, et autres
Publié: (2025)
ArtiWorld: LLM-Driven Articulation of 3D Objects in Scenes
par: Yang, Yixuan, et autres
Publié: (2025)
par: Yang, Yixuan, et autres
Publié: (2025)
VisHall3D: Monocular Semantic Scene Completion from Reconstructing the Visible Regions to Hallucinating the Invisible Regions
par: Lu, Haoang, et autres
Publié: (2025)
par: Lu, Haoang, et autres
Publié: (2025)
Bunny-VisionPro: Real-Time Bimanual Dexterous Teleoperation for Imitation Learning
par: Ding, Runyu, et autres
Publié: (2024)
par: Ding, Runyu, et autres
Publié: (2024)
Documents similaires
-
Can 3D Vision-Language Models Truly Understand Natural Language?
par: Deng, Weipeng, et autres
Publié: (2024) -
V-IRL: Grounding Virtual Intelligence in Real Life
par: Yang, Jihan, et autres
Publié: (2024) -
UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision
par: Wang, Yuru, et autres
Publié: (2024) -
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
par: Wang, Yan, et autres
Publié: (2025) -
OpenSU3D: Open World 3D Scene Understanding using Foundation Models
par: Mohiuddin, Rafay, et autres
Publié: (2024)