Grounded 3D-LLM with Referent Tokens
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yilun, Yang, Shuai, Huang, Haifeng, Wang, Tai, Xu, Runsen, Lyu, Ruiyuan, Lin, Dahua, Pang, Jiangmiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
di: Xu, Runsen, et al.
Pubblicazione: (2024)
di: Xu, Runsen, et al.
Pubblicazione: (2024)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
di: Hu, Miao, et al.
Pubblicazione: (2025)
di: Hu, Miao, et al.
Pubblicazione: (2025)
PointLLM: Empowering Large Language Models to Understand Point Clouds
di: Xu, Runsen, et al.
Pubblicazione: (2023)
di: Xu, Runsen, et al.
Pubblicazione: (2023)
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
Language-to-Space Programming for Training-Free 3D Visual Grounding
di: Mi, Boyu, et al.
Pubblicazione: (2025)
di: Mi, Boyu, et al.
Pubblicazione: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
di: Lin, Jingli, et al.
Pubblicazione: (2025)
di: Lin, Jingli, et al.
Pubblicazione: (2025)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
3DGSR: Implicit Surface Reconstruction with 3D Gaussian Splatting
di: Lyu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Lyu, Xiaoyang, et al.
Pubblicazione: (2024)
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
MGF: Mixed Gaussian Flow for Diverse Trajectory Prediction
di: Chen, Jiahe, et al.
Pubblicazione: (2024)
di: Chen, Jiahe, et al.
Pubblicazione: (2024)
Unified Human-Scene Interaction via Prompted Chain-of-Contacts
di: Xiao, Zeqi, et al.
Pubblicazione: (2023)
di: Xiao, Zeqi, et al.
Pubblicazione: (2023)
LoGoPlanner: Localization Grounded Navigation Policy with Metric-aware Visual Geometry
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
di: Lin, Jingli, et al.
Pubblicazione: (2025)
di: Lin, Jingli, et al.
Pubblicazione: (2025)
GenNBV: Generalizable Next-Best-View Policy for Active 3D Reconstruction
di: Chen, Xiao, et al.
Pubblicazione: (2024)
di: Chen, Xiao, et al.
Pubblicazione: (2024)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
di: Chen, Xiao, et al.
Pubblicazione: (2025)
di: Chen, Xiao, et al.
Pubblicazione: (2025)
A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning
di: Wen, Xin, et al.
Pubblicazione: (2025)
di: Wen, Xin, et al.
Pubblicazione: (2025)
AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views
di: Jiang, Lihan, et al.
Pubblicazione: (2025)
di: Jiang, Lihan, et al.
Pubblicazione: (2025)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
di: Huang, Xiaoshuang, et al.
Pubblicazione: (2024)
di: Huang, Xiaoshuang, et al.
Pubblicazione: (2024)
Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control
di: Fu, Xiao, et al.
Pubblicazione: (2025)
di: Fu, Xiao, et al.
Pubblicazione: (2025)
EAG-PT: Emission-Aware Gaussians and Path Tracing for Diffuse Indoor Scene Reconstruction and Editing
di: Yang, Xijie, et al.
Pubblicazione: (2026)
di: Yang, Xijie, et al.
Pubblicazione: (2026)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
di: Wen, Xin, et al.
Pubblicazione: (2024)
di: Wen, Xin, et al.
Pubblicazione: (2024)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation
di: Yang, Shuai, et al.
Pubblicazione: (2024)
di: Yang, Shuai, et al.
Pubblicazione: (2024)
Data-Efficient 3D Visual Grounding via Order-Aware Referring
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
di: Wei, Meng, et al.
Pubblicazione: (2025)
di: Wei, Meng, et al.
Pubblicazione: (2025)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
HaloGS: Loose Coupling of Compact Geometry and Gaussian Splats for 3D Scenes
di: Jiang, Changjian, et al.
Pubblicazione: (2025)
di: Jiang, Changjian, et al.
Pubblicazione: (2025)
Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground Scenes
di: Jiang, Lihan, et al.
Pubblicazione: (2024)
di: Jiang, Lihan, et al.
Pubblicazione: (2024)
Medical Referring Image Segmentation via Next-Token Mask Prediction
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
Omni6D: Large-Vocabulary 3D Object Dataset for Category-Level 6D Object Pose Estimation
di: Zhang, Mengchen, et al.
Pubblicazione: (2024)
di: Zhang, Mengchen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
di: Xu, Runsen, et al.
Pubblicazione: (2024) -
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024) -
ChangingGrounding: 3D Visual Grounding in Changing Scenes
di: Hu, Miao, et al.
Pubblicazione: (2025) -
PointLLM: Empowering Large Language Models to Understand Point Clouds
di: Xu, Runsen, et al.
Pubblicazione: (2023) -
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
di: Yang, Sihan, et al.
Pubblicazione: (2025)