Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Haifeng, Chen, Yilun, Wang, Zehan, Pang, Jiangmiao, Zhao, Zhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
Grounded 3D-LLM with Referent Tokens
di: Chen, Yilun, et al.
Pubblicazione: (2024)
di: Chen, Yilun, et al.
Pubblicazione: (2024)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
Language-to-Space Programming for Training-Free 3D Visual Grounding
di: Mi, Boyu, et al.
Pubblicazione: (2025)
di: Mi, Boyu, et al.
Pubblicazione: (2025)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
di: Xu, Runsen, et al.
Pubblicazione: (2024)
di: Xu, Runsen, et al.
Pubblicazione: (2024)
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
di: Hu, Miao, et al.
Pubblicazione: (2025)
di: Hu, Miao, et al.
Pubblicazione: (2025)
A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning
di: Wen, Xin, et al.
Pubblicazione: (2025)
di: Wen, Xin, et al.
Pubblicazione: (2025)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
di: Chen, Xiao, et al.
Pubblicazione: (2025)
di: Chen, Xiao, et al.
Pubblicazione: (2025)
PointLLM: Empowering Large Language Models to Understand Point Clouds
di: Xu, Runsen, et al.
Pubblicazione: (2023)
di: Xu, Runsen, et al.
Pubblicazione: (2023)
HaloGS: Loose Coupling of Compact Geometry and Gaussian Splats for 3D Scenes
di: Jiang, Changjian, et al.
Pubblicazione: (2025)
di: Jiang, Changjian, et al.
Pubblicazione: (2025)
3DGSR: Implicit Surface Reconstruction with 3D Gaussian Splatting
di: Lyu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Lyu, Xiaoyang, et al.
Pubblicazione: (2024)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
di: Wen, Xin, et al.
Pubblicazione: (2024)
di: Wen, Xin, et al.
Pubblicazione: (2024)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
ArtiWorld: LLM-Driven Articulation of 3D Objects in Scenes
di: Yang, Yixuan, et al.
Pubblicazione: (2025)
di: Yang, Yixuan, et al.
Pubblicazione: (2025)
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
FurnSet: Exploiting Repeats for 3D Scene Reconstruction
di: Dobre, Paul, et al.
Pubblicazione: (2026)
di: Dobre, Paul, et al.
Pubblicazione: (2026)
Potential Field as Scene Affordance for Behavior Change-Based Visual Risk Object Identification
di: Pao, Pang-Yuan, et al.
Pubblicazione: (2024)
di: Pao, Pang-Yuan, et al.
Pubblicazione: (2024)
ObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian Splatting
di: Zhu, Ruijie, et al.
Pubblicazione: (2025)
di: Zhu, Ruijie, et al.
Pubblicazione: (2025)
Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts
di: Fang, Shuangkang, et al.
Pubblicazione: (2024)
di: Fang, Shuangkang, et al.
Pubblicazione: (2024)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
ARTDECO: Towards Efficient and High-Fidelity On-the-Fly 3D Reconstruction with Structured Scene Representation
di: Li, Guanghao, et al.
Pubblicazione: (2025)
di: Li, Guanghao, et al.
Pubblicazione: (2025)
RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming
di: Chu, Jisheng, et al.
Pubblicazione: (2026)
di: Chu, Jisheng, et al.
Pubblicazione: (2026)
Scene-Conditional 3D Object Stylization and Composition
di: Zhou, Jinghao, et al.
Pubblicazione: (2023)
di: Zhou, Jinghao, et al.
Pubblicazione: (2023)
Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion
di: Liu, Enyu, et al.
Pubblicazione: (2025)
di: Liu, Enyu, et al.
Pubblicazione: (2025)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
di: Lin, Jingli, et al.
Pubblicazione: (2025)
di: Lin, Jingli, et al.
Pubblicazione: (2025)
Unified Human-Scene Interaction via Prompted Chain-of-Contacts
di: Xiao, Zeqi, et al.
Pubblicazione: (2023)
di: Xiao, Zeqi, et al.
Pubblicazione: (2023)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
di: Wei, Meng, et al.
Pubblicazione: (2025)
di: Wei, Meng, et al.
Pubblicazione: (2025)
Style-Consistent 3D Indoor Scene Synthesis with Decoupled Objects
di: Zhang, Yunfan, et al.
Pubblicazione: (2024)
di: Zhang, Yunfan, et al.
Pubblicazione: (2024)
GenNBV: Generalizable Next-Best-View Policy for Active 3D Reconstruction
di: Chen, Xiao, et al.
Pubblicazione: (2024)
di: Chen, Xiao, et al.
Pubblicazione: (2024)
A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes
di: Yu, Ting, et al.
Pubblicazione: (2024)
di: Yu, Ting, et al.
Pubblicazione: (2024)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning
di: Hao, Jinkun, et al.
Pubblicazione: (2025)
di: Hao, Jinkun, et al.
Pubblicazione: (2025)
GenSpace: Benchmarking Spatially-Aware Image Generation
di: Wang, Zehan, et al.
Pubblicazione: (2025)
di: Wang, Zehan, et al.
Pubblicazione: (2025)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
Improving Classification of Occluded Objects through Scene Context
di: King, Courtney M., et al.
Pubblicazione: (2025)
di: King, Courtney M., et al.
Pubblicazione: (2025)
IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection
di: Yin, Junbo, et al.
Pubblicazione: (2024)
di: Yin, Junbo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
di: Huang, Haifeng, et al.
Pubblicazione: (2023) -
Grounded 3D-LLM with Referent Tokens
di: Chen, Yilun, et al.
Pubblicazione: (2024) -
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
di: Huang, Haifeng, et al.
Pubblicazione: (2025) -
Language-to-Space Programming for Training-Free 3D Visual Grounding
di: Mi, Boyu, et al.
Pubblicazione: (2025) -
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
di: Xu, Runsen, et al.
Pubblicazione: (2024)