Grounded 3D-LLM with Referent Tokens
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Yilun, Yang, Shuai, Huang, Haifeng, Wang, Tai, Xu, Runsen, Lyu, Ruiyuan, Lin, Dahua, Pang, Jiangmiao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
von: Xu, Runsen, et al.
Veröffentlicht: (2024)
von: Xu, Runsen, et al.
Veröffentlicht: (2024)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
von: Lyu, Ruiyuan, et al.
Veröffentlicht: (2024)
von: Lyu, Ruiyuan, et al.
Veröffentlicht: (2024)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
von: Hu, Miao, et al.
Veröffentlicht: (2025)
von: Hu, Miao, et al.
Veröffentlicht: (2025)
PointLLM: Empowering Large Language Models to Understand Point Clouds
von: Xu, Runsen, et al.
Veröffentlicht: (2023)
von: Xu, Runsen, et al.
Veröffentlicht: (2023)
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
von: Huang, Haifeng, et al.
Veröffentlicht: (2026)
von: Huang, Haifeng, et al.
Veröffentlicht: (2026)
Language-to-Space Programming for Training-Free 3D Visual Grounding
von: Mi, Boyu, et al.
Veröffentlicht: (2025)
von: Mi, Boyu, et al.
Veröffentlicht: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
von: Huang, Haifeng, et al.
Veröffentlicht: (2023)
von: Huang, Haifeng, et al.
Veröffentlicht: (2023)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
von: Huang, Haifeng, et al.
Veröffentlicht: (2025)
von: Huang, Haifeng, et al.
Veröffentlicht: (2025)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
von: Lin, Jingli, et al.
Veröffentlicht: (2025)
von: Lin, Jingli, et al.
Veröffentlicht: (2025)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
von: Li, Hao, et al.
Veröffentlicht: (2025)
von: Li, Hao, et al.
Veröffentlicht: (2025)
3DGSR: Implicit Surface Reconstruction with 3D Gaussian Splatting
von: Lyu, Xiaoyang, et al.
Veröffentlicht: (2024)
von: Lyu, Xiaoyang, et al.
Veröffentlicht: (2024)
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
von: Peng, Jiaqi, et al.
Veröffentlicht: (2025)
von: Peng, Jiaqi, et al.
Veröffentlicht: (2025)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
von: Zhu, Chenming, et al.
Veröffentlicht: (2024)
von: Zhu, Chenming, et al.
Veröffentlicht: (2024)
MGF: Mixed Gaussian Flow for Diverse Trajectory Prediction
von: Chen, Jiahe, et al.
Veröffentlicht: (2024)
von: Chen, Jiahe, et al.
Veröffentlicht: (2024)
Unified Human-Scene Interaction via Prompted Chain-of-Contacts
von: Xiao, Zeqi, et al.
Veröffentlicht: (2023)
von: Xiao, Zeqi, et al.
Veröffentlicht: (2023)
LoGoPlanner: Localization Grounded Navigation Policy with Metric-aware Visual Geometry
von: Peng, Jiaqi, et al.
Veröffentlicht: (2025)
von: Peng, Jiaqi, et al.
Veröffentlicht: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
von: Yang, Shuai, et al.
Veröffentlicht: (2025)
von: Yang, Shuai, et al.
Veröffentlicht: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
von: Lin, Jingli, et al.
Veröffentlicht: (2025)
von: Lin, Jingli, et al.
Veröffentlicht: (2025)
GenNBV: Generalizable Next-Best-View Policy for Active 3D Reconstruction
von: Chen, Xiao, et al.
Veröffentlicht: (2024)
von: Chen, Xiao, et al.
Veröffentlicht: (2024)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
von: Chen, Xiao, et al.
Veröffentlicht: (2025)
von: Chen, Xiao, et al.
Veröffentlicht: (2025)
A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning
von: Wen, Xin, et al.
Veröffentlicht: (2025)
von: Wen, Xin, et al.
Veröffentlicht: (2025)
AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views
von: Jiang, Lihan, et al.
Veröffentlicht: (2025)
von: Jiang, Lihan, et al.
Veröffentlicht: (2025)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control
von: Fu, Xiao, et al.
Veröffentlicht: (2025)
von: Fu, Xiao, et al.
Veröffentlicht: (2025)
EAG-PT: Emission-Aware Gaussians and Path Tracing for Diffuse Indoor Scene Reconstruction and Editing
von: Yang, Xijie, et al.
Veröffentlicht: (2026)
von: Yang, Xijie, et al.
Veröffentlicht: (2026)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
von: Wen, Xin, et al.
Veröffentlicht: (2024)
von: Wen, Xin, et al.
Veröffentlicht: (2024)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
von: Huang, Haifeng, et al.
Veröffentlicht: (2026)
von: Huang, Haifeng, et al.
Veröffentlicht: (2026)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
von: Miao, Xingyu, et al.
Veröffentlicht: (2026)
von: Miao, Xingyu, et al.
Veröffentlicht: (2026)
LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation
von: Yang, Shuai, et al.
Veröffentlicht: (2024)
von: Yang, Shuai, et al.
Veröffentlicht: (2024)
Data-Efficient 3D Visual Grounding via Order-Aware Referring
von: Wu, Tung-Yu, et al.
Veröffentlicht: (2024)
von: Wu, Tung-Yu, et al.
Veröffentlicht: (2024)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
von: Wang, Liuyi, et al.
Veröffentlicht: (2025)
von: Wang, Liuyi, et al.
Veröffentlicht: (2025)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
von: Wei, Meng, et al.
Veröffentlicht: (2025)
von: Wei, Meng, et al.
Veröffentlicht: (2025)
Multi-Object Tracking by Hierarchical Visual Representations
von: Cao, Jinkun, et al.
Veröffentlicht: (2024)
von: Cao, Jinkun, et al.
Veröffentlicht: (2024)
HaloGS: Loose Coupling of Compact Geometry and Gaussian Splats for 3D Scenes
von: Jiang, Changjian, et al.
Veröffentlicht: (2025)
von: Jiang, Changjian, et al.
Veröffentlicht: (2025)
Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground Scenes
von: Jiang, Lihan, et al.
Veröffentlicht: (2024)
von: Jiang, Lihan, et al.
Veröffentlicht: (2024)
Medical Referring Image Segmentation via Next-Token Mask Prediction
von: Chen, Xinyu, et al.
Veröffentlicht: (2025)
von: Chen, Xinyu, et al.
Veröffentlicht: (2025)
Omni6D: Large-Vocabulary 3D Object Dataset for Category-Level 6D Object Pose Estimation
von: Zhang, Mengchen, et al.
Veröffentlicht: (2024)
von: Zhang, Mengchen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
von: Xu, Runsen, et al.
Veröffentlicht: (2024) -
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
von: Lyu, Ruiyuan, et al.
Veröffentlicht: (2024) -
ChangingGrounding: 3D Visual Grounding in Changing Scenes
von: Hu, Miao, et al.
Veröffentlicht: (2025) -
PointLLM: Empowering Large Language Models to Understand Point Clouds
von: Xu, Runsen, et al.
Veröffentlicht: (2023) -
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
von: Yang, Sihan, et al.
Veröffentlicht: (2025)