ChangingGrounding: 3D Visual Grounding in Changing Scenes
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Miao, Huang, Zhiwei, Wang, Tai, Pang, Jiangmiao, Lin, Dahua, Zheng, Nanning, Xu, Runsen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
por: Xu, Runsen, et al.
Publicado: (2024)
por: Xu, Runsen, et al.
Publicado: (2024)
Grounded 3D-LLM with Referent Tokens
por: Chen, Yilun, et al.
Publicado: (2024)
por: Chen, Yilun, et al.
Publicado: (2024)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
por: Lyu, Ruiyuan, et al.
Publicado: (2024)
por: Lyu, Ruiyuan, et al.
Publicado: (2024)
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
por: Yang, Sihan, et al.
Publicado: (2025)
por: Yang, Sihan, et al.
Publicado: (2025)
Language-to-Space Programming for Training-Free 3D Visual Grounding
por: Mi, Boyu, et al.
Publicado: (2025)
por: Mi, Boyu, et al.
Publicado: (2025)
PointLLM: Empowering Large Language Models to Understand Point Clouds
por: Xu, Runsen, et al.
Publicado: (2023)
por: Xu, Runsen, et al.
Publicado: (2023)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
por: Hu, Wenbo, et al.
Publicado: (2025)
por: Hu, Wenbo, et al.
Publicado: (2025)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
por: Lin, Jingli, et al.
Publicado: (2025)
por: Lin, Jingli, et al.
Publicado: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
por: Huang, Haifeng, et al.
Publicado: (2023)
por: Huang, Haifeng, et al.
Publicado: (2023)
LoGoPlanner: Localization Grounded Navigation Policy with Metric-aware Visual Geometry
por: Peng, Jiaqi, et al.
Publicado: (2025)
por: Peng, Jiaqi, et al.
Publicado: (2025)
Unified Human-Scene Interaction via Prompted Chain-of-Contacts
por: Xiao, Zeqi, et al.
Publicado: (2023)
por: Xiao, Zeqi, et al.
Publicado: (2023)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
por: Huang, Haifeng, et al.
Publicado: (2025)
por: Huang, Haifeng, et al.
Publicado: (2025)
UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing
por: Zhang, Jiaxi, et al.
Publicado: (2026)
por: Zhang, Jiaxi, et al.
Publicado: (2026)
Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground Scenes
por: Jiang, Lihan, et al.
Publicado: (2024)
por: Jiang, Lihan, et al.
Publicado: (2024)
Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
por: Huang, Haifeng, et al.
Publicado: (2026)
por: Huang, Haifeng, et al.
Publicado: (2026)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
por: Chen, Xiao, et al.
Publicado: (2025)
por: Chen, Xiao, et al.
Publicado: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
por: Lin, Jingli, et al.
Publicado: (2025)
por: Lin, Jingli, et al.
Publicado: (2025)
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
por: Peng, Jiaqi, et al.
Publicado: (2025)
por: Peng, Jiaqi, et al.
Publicado: (2025)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
por: Zhu, Chenming, et al.
Publicado: (2024)
por: Zhu, Chenming, et al.
Publicado: (2024)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
por: Yang, Sihan, et al.
Publicado: (2025)
por: Yang, Sihan, et al.
Publicado: (2025)
GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning
por: Miao, Deshui, et al.
Publicado: (2026)
por: Miao, Deshui, et al.
Publicado: (2026)
MGF: Mixed Gaussian Flow for Diverse Trajectory Prediction
por: Chen, Jiahe, et al.
Publicado: (2024)
por: Chen, Jiahe, et al.
Publicado: (2024)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
por: Zheng, Henry, et al.
Publicado: (2025)
por: Zheng, Henry, et al.
Publicado: (2025)
Ground4D: Spatially-Grounded Feedforward 4D Reconstruction for Unstructured Off-Road Scenes
por: Wang, Shuo, et al.
Publicado: (2026)
por: Wang, Shuo, et al.
Publicado: (2026)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
por: Miao, Xingyu, et al.
Publicado: (2026)
por: Miao, Xingyu, et al.
Publicado: (2026)
Task-oriented Sequential Grounding and Navigation in 3D Scenes
por: Zhang, Zhuofan, et al.
Publicado: (2024)
por: Zhang, Zhuofan, et al.
Publicado: (2024)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
por: Xu, Xiaoxu, et al.
Publicado: (2023)
por: Xu, Xiaoxu, et al.
Publicado: (2023)
MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding
por: Chang, Chun-Peng, et al.
Publicado: (2024)
por: Chang, Chun-Peng, et al.
Publicado: (2024)
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
por: Wang, Qirui, et al.
Publicado: (2026)
por: Wang, Qirui, et al.
Publicado: (2026)
R2G: Reasoning to Ground in 3D Scenes
por: Li, Yixuan, et al.
Publicado: (2024)
por: Li, Yixuan, et al.
Publicado: (2024)
Unified Representation Space for 3D Visual Grounding
por: Zheng, Yinuo, et al.
Publicado: (2025)
por: Zheng, Yinuo, et al.
Publicado: (2025)
SGFormer: Satellite-Ground Fusion for 3D Semantic Scene Completion
por: Guo, Xiyue, et al.
Publicado: (2025)
por: Guo, Xiyue, et al.
Publicado: (2025)
LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding
por: Xiao, Feng, et al.
Publicado: (2025)
por: Xiao, Feng, et al.
Publicado: (2025)
EAG-PT: Emission-Aware Gaussians and Path Tracing for Diffuse Indoor Scene Reconstruction and Editing
por: Yang, Xijie, et al.
Publicado: (2026)
por: Yang, Xijie, et al.
Publicado: (2026)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
por: Qian, Zhipeng, et al.
Publicado: (2024)
por: Qian, Zhipeng, et al.
Publicado: (2024)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
por: Zhu, Chenming, et al.
Publicado: (2024)
por: Zhu, Chenming, et al.
Publicado: (2024)
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
por: Zhu, Ziyu, et al.
Publicado: (2025)
por: Zhu, Ziyu, et al.
Publicado: (2025)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
por: Linghu, Xiongkun, et al.
Publicado: (2025)
por: Linghu, Xiongkun, et al.
Publicado: (2025)
A Simple and Better Baseline for Visual Grounding
por: Wang, Jingchao, et al.
Publicado: (2025)
por: Wang, Jingchao, et al.
Publicado: (2025)
ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding
por: Peng, Qihang, et al.
Publicado: (2025)
por: Peng, Qihang, et al.
Publicado: (2025)
Ejemplares similares
-
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
por: Xu, Runsen, et al.
Publicado: (2024) -
Grounded 3D-LLM with Referent Tokens
por: Chen, Yilun, et al.
Publicado: (2024) -
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
por: Lyu, Ruiyuan, et al.
Publicado: (2024) -
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
por: Yang, Sihan, et al.
Publicado: (2025) -
Language-to-Space Programming for Training-Free 3D Visual Grounding
por: Mi, Boyu, et al.
Publicado: (2025)