Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Haoyuan, Liu, Rui, Fan, Hehe, Yang, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
por: Jia, Baoxiong, et al.
Publicado: (2024)
por: Jia, Baoxiong, et al.
Publicado: (2024)
FunGraph: Functionality Aware 3D Scene Graphs for Language-Prompted Scene Interaction
por: Rotondi, Dennis, et al.
Publicado: (2025)
por: Rotondi, Dennis, et al.
Publicado: (2025)
On Deep Learning for Geometric and Semantic Scene Understanding Using On-Vehicle 3D LiDAR
por: Li, Li
Publicado: (2024)
por: Li, Li
Publicado: (2024)
PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI
por: Yang, Yandan, et al.
Publicado: (2024)
por: Yang, Yandan, et al.
Publicado: (2024)
From Scene to Object: Text-Guided Dual-Gaze Prediction
por: Ke, Zehong, et al.
Publicado: (2026)
por: Ke, Zehong, et al.
Publicado: (2026)
Enhancing Vision-Language Models with Scene Graphs for Traffic Accident Understanding
por: Lohner, Aaron, et al.
Publicado: (2024)
por: Lohner, Aaron, et al.
Publicado: (2024)
PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes
por: Abdelreheem, Ahmed, et al.
Publicado: (2025)
por: Abdelreheem, Ahmed, et al.
Publicado: (2025)
SceneFoundry: Generating Interactive Infinite 3D Worlds
por: Chen, ChunTeng, et al.
Publicado: (2026)
por: Chen, ChunTeng, et al.
Publicado: (2026)
3D Scene Rendering with Multimodal Gaussian Splatting
por: Gau, Chi-Shiang, et al.
Publicado: (2026)
por: Gau, Chi-Shiang, et al.
Publicado: (2026)
Multi-modal Situated Reasoning in 3D Scenes
por: Linghu, Xiongkun, et al.
Publicado: (2024)
por: Linghu, Xiongkun, et al.
Publicado: (2024)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
por: Lyu, Ruiyuan, et al.
Publicado: (2024)
por: Lyu, Ruiyuan, et al.
Publicado: (2024)
CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
por: Gan, Rui, et al.
Publicado: (2026)
por: Gan, Rui, et al.
Publicado: (2026)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
por: Li, Haoyuan, et al.
Publicado: (2026)
por: Li, Haoyuan, et al.
Publicado: (2026)
Explainable Scene Understanding with Qualitative Representations and Graph Neural Networks
por: Belmecheri, Nassim, et al.
Publicado: (2025)
por: Belmecheri, Nassim, et al.
Publicado: (2025)
Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving
por: Gao, Haoxiang, et al.
Publicado: (2025)
por: Gao, Haoxiang, et al.
Publicado: (2025)
Planning with the Views via Scene Self-Exploration
por: Wang, Kangrui, et al.
Publicado: (2026)
por: Wang, Kangrui, et al.
Publicado: (2026)
GaRField++: Reinforced Gaussian Radiance Fields for Large-Scale 3D Scene Reconstruction
por: Zhang, Hanyue, et al.
Publicado: (2024)
por: Zhang, Hanyue, et al.
Publicado: (2024)
SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes
por: Pfaff, Nicholas, et al.
Publicado: (2026)
por: Pfaff, Nicholas, et al.
Publicado: (2026)
LLM-Driven 3D Scene Generation of Agricultural Simulation Environments
por: Yoncalik, Arafa, et al.
Publicado: (2026)
por: Yoncalik, Arafa, et al.
Publicado: (2026)
Articulated 3D Scene Graphs for Open-World Mobile Manipulation
por: Büchner, Martin, et al.
Publicado: (2026)
por: Büchner, Martin, et al.
Publicado: (2026)
3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation
por: Zhang, Frank, et al.
Publicado: (2024)
por: Zhang, Frank, et al.
Publicado: (2024)
RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation
por: Chang, Yue, et al.
Publicado: (2026)
por: Chang, Yue, et al.
Publicado: (2026)
Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction
por: Yang, Yiru, et al.
Publicado: (2026)
por: Yang, Yiru, et al.
Publicado: (2026)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
por: Halacheva, Anna-Maria, et al.
Publicado: (2024)
por: Halacheva, Anna-Maria, et al.
Publicado: (2024)
Language-Assisted 3D Scene Understanding
por: Wu, Yanmin, et al.
Publicado: (2023)
por: Wu, Yanmin, et al.
Publicado: (2023)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
por: Chen, Xiao, et al.
Publicado: (2025)
por: Chen, Xiao, et al.
Publicado: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
por: Hao, Haihong, et al.
Publicado: (2026)
por: Hao, Haihong, et al.
Publicado: (2026)
Diffusion-guided Generalizable Enhancer for Urban Scene Reconstruction
por: Che, Henry, et al.
Publicado: (2026)
por: Che, Henry, et al.
Publicado: (2026)
RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots
por: Modi, Giorgia, et al.
Publicado: (2026)
por: Modi, Giorgia, et al.
Publicado: (2026)
RoadFormer: Duplex Transformer for RGB-Normal Semantic Road Scene Parsing
por: Li, Jiahang, et al.
Publicado: (2023)
por: Li, Jiahang, et al.
Publicado: (2023)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
por: Zhang, Jiwen, et al.
Publicado: (2026)
por: Zhang, Jiwen, et al.
Publicado: (2026)
MetaScenes: Towards Automated Replica Creation for Real-world 3D Scans
por: Yu, Huangyue, et al.
Publicado: (2025)
por: Yu, Huangyue, et al.
Publicado: (2025)
Fixed External Cameras as Common Prior Maps for Active 3D Scene Graph Generation
por: Modi, Giorgia, et al.
Publicado: (2026)
por: Modi, Giorgia, et al.
Publicado: (2026)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
por: Man, Yunze, et al.
Publicado: (2024)
por: Man, Yunze, et al.
Publicado: (2024)
Lightweight Multimodal Artificial Intelligence Framework for Maritime Multi-Scene Recognition
por: Xi, Xinyu, et al.
Publicado: (2025)
por: Xi, Xinyu, et al.
Publicado: (2025)
MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks
por: Che, Lirong, et al.
Publicado: (2026)
por: Che, Lirong, et al.
Publicado: (2026)
DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding
por: Ge, Luzhou, et al.
Publicado: (2026)
por: Ge, Luzhou, et al.
Publicado: (2026)
Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models
por: Bharadwaj, Sagar, et al.
Publicado: (2026)
por: Bharadwaj, Sagar, et al.
Publicado: (2026)
Bharat Scene Text: A Novel Comprehensive Dataset and Benchmark for Indian Language Scene Text Understanding
por: De, Anik, et al.
Publicado: (2025)
por: De, Anik, et al.
Publicado: (2025)
DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian Splatting
por: Zhou, Shijie, et al.
Publicado: (2024)
por: Zhou, Shijie, et al.
Publicado: (2024)
Ejemplares similares
-
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
por: Jia, Baoxiong, et al.
Publicado: (2024) -
FunGraph: Functionality Aware 3D Scene Graphs for Language-Prompted Scene Interaction
por: Rotondi, Dennis, et al.
Publicado: (2025) -
On Deep Learning for Geometric and Semantic Scene Understanding Using On-Vehicle 3D LiDAR
por: Li, Li
Publicado: (2024) -
PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI
por: Yang, Yandan, et al.
Publicado: (2024) -
From Scene to Object: Text-Guided Dual-Gaze Prediction
por: Ke, Zehong, et al.
Publicado: (2026)