Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Hanxun, Li, Wentong, Wang, Song, Chen, Junbo, Zhu, Jianke |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
par: Yu, Hanxun, et autres
Publié: (2026)
par: Yu, Hanxun, et autres
Publié: (2026)
InstDrive: Instance-Aware 3D Gaussian Splatting for Driving Scenes
par: Liu, Hongyuan, et autres
Publié: (2025)
par: Liu, Hongyuan, et autres
Publié: (2025)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation
par: Wang, Song, et autres
Publié: (2024)
par: Wang, Song, et autres
Publié: (2024)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
par: Shi, Zhan, et autres
Publié: (2025)
par: Shi, Zhan, et autres
Publié: (2025)
Label-efficient Semantic Scene Completion with Scribble Annotations
par: Wang, Song, et autres
Publié: (2024)
par: Wang, Song, et autres
Publié: (2024)
Osprey: Pixel Understanding with Visual Instruction Tuning
par: Yuan, Yuqian, et autres
Publié: (2023)
par: Yuan, Yuqian, et autres
Publié: (2023)
Uncertainty-Instructed Structure Injection for Generalizable HD Map Construction
par: Liu, Xiaolu, et autres
Publié: (2025)
par: Liu, Xiaolu, et autres
Publié: (2025)
MGMap: Mask-Guided Learning for Online Vectorized HD Map Construction
par: Liu, Xiaolu, et autres
Publié: (2024)
par: Liu, Xiaolu, et autres
Publié: (2024)
Reg3D: Reconstructive Geometry Instruction Tuning for 3D Scene Understanding
par: Zheng, Hongpei, et autres
Publié: (2025)
par: Zheng, Hongpei, et autres
Publié: (2025)
ReliOcc: Towards Reliable Semantic Occupancy Prediction via Uncertainty Learning
par: Wang, Song, et autres
Publié: (2024)
par: Wang, Song, et autres
Publié: (2024)
IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection
par: Yin, Junbo, et autres
Publié: (2024)
par: Yin, Junbo, et autres
Publié: (2024)
Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion
par: Liu, Enyu, et autres
Publié: (2025)
par: Liu, Enyu, et autres
Publié: (2025)
HO-Gaussian: Hybrid Optimization of 3D Gaussian Splatting for Urban Scenes
par: Li, Zhuopeng, et autres
Publié: (2024)
par: Li, Zhuopeng, et autres
Publié: (2024)
InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding
par: Kumar, Ashutosh, et autres
Publié: (2026)
par: Kumar, Ashutosh, et autres
Publié: (2026)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
par: Huang, Wencan, et autres
Publié: (2025)
par: Huang, Wencan, et autres
Publié: (2025)
3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding
par: Wang, Xiaoye, et autres
Publié: (2025)
par: Wang, Xiaoye, et autres
Publié: (2025)
Unlocking Dense Metric Depth Estimation in VLMs
par: Yu, Hanxun, et autres
Publié: (2026)
par: Yu, Hanxun, et autres
Publié: (2026)
Fine-Grained Multi-View Hand Reconstruction Using Inverse Rendering
par: Gan, Qijun, et autres
Publié: (2024)
par: Gan, Qijun, et autres
Publié: (2024)
SAI3D: Segment Any Instance in 3D Scenes
par: Yin, Yingda, et autres
Publié: (2023)
par: Yin, Yingda, et autres
Publié: (2023)
Inst4DGS: Instance-Decomposed 4D Gaussian Splatting with Multi-Video Label Permutation Learning
par: Lee, Yonghan, et autres
Publié: (2026)
par: Lee, Yonghan, et autres
Publié: (2026)
UnScene3D: Unsupervised 3D Instance Segmentation for Indoor Scenes
par: Rozenberszki, David, et autres
Publié: (2023)
par: Rozenberszki, David, et autres
Publié: (2023)
MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation
par: Huang, Zehuan, et autres
Publié: (2024)
par: Huang, Zehuan, et autres
Publié: (2024)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
par: Yin, Yuehao, et autres
Publié: (2023)
par: Yin, Yuehao, et autres
Publié: (2023)
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
par: Yang, Bin, et autres
Publié: (2026)
par: Yang, Bin, et autres
Publié: (2026)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
par: Yang, Yu-Qi, et autres
Publié: (2024)
par: Yang, Yu-Qi, et autres
Publié: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
AutoInst: Automatic Instance-Based Segmentation of LiDAR 3D Scans
par: Perauer, Cedric, et autres
Publié: (2024)
par: Perauer, Cedric, et autres
Publié: (2024)
HVOFusion: Incremental Mesh Reconstruction Using Hybrid Voxel Octree
par: Liu, Shaofan, et autres
Publié: (2024)
par: Liu, Shaofan, et autres
Publié: (2024)
3D Question Answering for City Scene Understanding
par: Sun, Penglei, et autres
Publié: (2024)
par: Sun, Penglei, et autres
Publié: (2024)
AG$^2$aussian: Anchor-Graph Structured Gaussian Splatting for Instance-Level 3D Scene Understanding and Editing
par: Wang, Zhaonan, et autres
Publié: (2025)
par: Wang, Zhaonan, et autres
Publié: (2025)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
par: Ji, Jiayi, et autres
Publié: (2023)
par: Ji, Jiayi, et autres
Publié: (2023)
UDA4Inst: Unsupervised Domain Adaptation for Instance Segmentation
par: Guo, Yachan, et autres
Publié: (2024)
par: Guo, Yachan, et autres
Publié: (2024)
INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
par: Peng, Wujian, et autres
Publié: (2024)
par: Peng, Wujian, et autres
Publié: (2024)
WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories
par: Zhang, Yisu, et autres
Publié: (2026)
par: Zhang, Yisu, et autres
Publié: (2026)
Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing
par: Liu, Xiaolu, et autres
Publié: (2026)
par: Liu, Xiaolu, et autres
Publié: (2026)
Multi-modal Situated Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2024)
par: Linghu, Xiongkun, et autres
Publié: (2024)
Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering
par: Li, Zechuan, et autres
Publié: (2025)
par: Li, Zechuan, et autres
Publié: (2025)
Instance Tracking in 3D Scenes from Egocentric Videos
par: Zhao, Yunhan, et autres
Publié: (2023)
par: Zhao, Yunhan, et autres
Publié: (2023)
ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
Documents similaires
-
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
par: Yu, Hanxun, et autres
Publié: (2026) -
InstDrive: Instance-Aware 3D Gaussian Splatting for Driving Scenes
par: Liu, Hongyuan, et autres
Publié: (2025) -
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024) -
Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation
par: Wang, Song, et autres
Publié: (2024) -
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
par: Shi, Zhan, et autres
Publié: (2025)