Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chunshi, Ye, Junliang, Yang, Yunhan, Li, Yang, Lin, Zizhuo, Zhu, Jun, Chen, Zhuo, Luo, Yawei, Guo, Chunchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
P3-SAM: Native 3D Part Segmentation
di: Ma, Changfeng, et al.
Pubblicazione: (2025)
di: Ma, Changfeng, et al.
Pubblicazione: (2025)
X-Part: high fidelity and structure coherent shape decomposition
di: Yan, Xinhao, et al.
Pubblicazione: (2025)
di: Yan, Xinhao, et al.
Pubblicazione: (2025)
PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World
di: Yang, Yunhan, et al.
Pubblicazione: (2026)
di: Yang, Yunhan, et al.
Pubblicazione: (2026)
SARe: Structure-Aware Large-Scale 3D Fragment Reassembly
di: Jia, Hanze, et al.
Pubblicazione: (2026)
di: Jia, Hanze, et al.
Pubblicazione: (2026)
HoloPart: Generative 3D Part Amodal Segmentation
di: Yang, Yunhan, et al.
Pubblicazione: (2025)
di: Yang, Yunhan, et al.
Pubblicazione: (2025)
Part123: Part-aware 3D Reconstruction from a Single-view Image
di: Liu, Anran, et al.
Pubblicazione: (2024)
di: Liu, Anran, et al.
Pubblicazione: (2024)
SAMPart3D: Segment Any Part in 3D Objects
di: Yang, Yunhan, et al.
Pubblicazione: (2024)
di: Yang, Yunhan, et al.
Pubblicazione: (2024)
OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion
di: Yang, Yunhan, et al.
Pubblicazione: (2025)
di: Yang, Yunhan, et al.
Pubblicazione: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
di: Ye, Junliang, et al.
Pubblicazione: (2025)
di: Ye, Junliang, et al.
Pubblicazione: (2025)
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation
di: Umam, Ardian, et al.
Pubblicazione: (2023)
di: Umam, Ardian, et al.
Pubblicazione: (2023)
MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning
di: Wang, Chenyu, et al.
Pubblicazione: (2024)
di: Wang, Chenyu, et al.
Pubblicazione: (2024)
WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
di: Yang, Yichen, et al.
Pubblicazione: (2025)
di: Yang, Yichen, et al.
Pubblicazione: (2025)
Compositional 3D-aware Video Generation with LLM Director
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
MLLM-CL: Continual Learning for Multimodal Large Language Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation
di: Deng, Ken, et al.
Pubblicazione: (2025)
di: Deng, Ken, et al.
Pubblicazione: (2025)
UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents
di: He, Xufan, et al.
Pubblicazione: (2025)
di: He, Xufan, et al.
Pubblicazione: (2025)
RomanTex: Decoupling 3D-aware Rotary Positional Embedded Multi-Attention Network for Texture Synthesis
di: Feng, Yifei, et al.
Pubblicazione: (2025)
di: Feng, Yifei, et al.
Pubblicazione: (2025)
MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation
di: Li, Zhiqi, et al.
Pubblicazione: (2025)
di: Li, Zhiqi, et al.
Pubblicazione: (2025)
StepNet: Spatial-temporal Part-aware Network for Isolated Sign Language Recognition
di: Shen, Xiaolong, et al.
Pubblicazione: (2022)
di: Shen, Xiaolong, et al.
Pubblicazione: (2022)
QuadGPT: Native Quadrilateral Mesh Generation with Autoregressive Models
di: Liu, Jian, et al.
Pubblicazione: (2025)
di: Liu, Jian, et al.
Pubblicazione: (2025)
ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation
di: Quan, Jinsheng, et al.
Pubblicazione: (2025)
di: Quan, Jinsheng, et al.
Pubblicazione: (2025)
ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation
di: Sun, Hanxiao, et al.
Pubblicazione: (2026)
di: Sun, Hanxiao, et al.
Pubblicazione: (2026)
MaGS: Reconstructing and Simulating Dynamic 3D Objects with Mesh-adsorbed Gaussian Splatting
di: Ma, Shaojie, et al.
Pubblicazione: (2024)
di: Ma, Shaojie, et al.
Pubblicazione: (2024)
Self-supervised Learning of Hybrid Part-aware 3D Representations of 2D Gaussians and Superquadrics
di: Gao, Zhirui, et al.
Pubblicazione: (2024)
di: Gao, Zhirui, et al.
Pubblicazione: (2024)
MimicParts: Part-aware Style Injection for Speech-Driven 3D Motion Generation
di: Liu, Lianlian, et al.
Pubblicazione: (2025)
di: Liu, Lianlian, et al.
Pubblicazione: (2025)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
di: Wu, Mingrui, et al.
Pubblicazione: (2024)
di: Wu, Mingrui, et al.
Pubblicazione: (2024)
Part-aware Unified Representation of Language and Skeleton for Zero-shot Action Recognition
di: Zhu, Anqi, et al.
Pubblicazione: (2024)
di: Zhu, Anqi, et al.
Pubblicazione: (2024)
A Multi-Stage Framework for 3D Individual Tooth Segmentation in Dental CBCT
di: Wang, Chunshi, et al.
Pubblicazione: (2024)
di: Wang, Chunshi, et al.
Pubblicazione: (2024)
PinPoint3D: Fine-Grained 3D Part Segmentation from a Few Clicks
di: Zhang, Bojun, et al.
Pubblicazione: (2025)
di: Zhang, Bojun, et al.
Pubblicazione: (2025)
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
Epipolar-Free 3D Gaussian Splatting for Generalizable Novel View Synthesis
di: Min, Zhiyuan, et al.
Pubblicazione: (2024)
di: Min, Zhiyuan, et al.
Pubblicazione: (2024)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models
di: Guo, Yuxiang, et al.
Pubblicazione: (2024)
di: Guo, Yuxiang, et al.
Pubblicazione: (2024)
Direction-aware 3D Large Multimodal Models
di: Liu, Quan, et al.
Pubblicazione: (2026)
di: Liu, Quan, et al.
Pubblicazione: (2026)
OCC-MLLM:Empowering Multimodal Large Language Model For the Understanding of Occluded Objects
di: Qiu, Wenmo, et al.
Pubblicazione: (2024)
di: Qiu, Wenmo, et al.
Pubblicazione: (2024)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
di: Kareem, Amrin, et al.
Pubblicazione: (2024)
di: Kareem, Amrin, et al.
Pubblicazione: (2024)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025)
di: Liu, Zhe, et al.
Pubblicazione: (2025)
PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data
di: Zhu, Zhe, et al.
Pubblicazione: (2025)
di: Zhu, Zhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
P3-SAM: Native 3D Part Segmentation
di: Ma, Changfeng, et al.
Pubblicazione: (2025) -
X-Part: high fidelity and structure coherent shape decomposition
di: Yan, Xinhao, et al.
Pubblicazione: (2025) -
PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World
di: Yang, Yunhan, et al.
Pubblicazione: (2026) -
SARe: Structure-Aware Large-Scale 3D Fragment Reassembly
di: Jia, Hanze, et al.
Pubblicazione: (2026) -
HoloPart: Generative 3D Part Amodal Segmentation
di: Yang, Yunhan, et al.
Pubblicazione: (2025)