Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Lei, Yinjie, Wang, Zixuan, Chen, Feng, Wang, Guoqing, Wang, Peng, Yang, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Training-free Dense-Aligned Diffusion Guidance for Modular Conditional Image Synthesis
por: Wang, Zixuan, et al.
Publicado: (2025)
por: Wang, Zixuan, et al.
Publicado: (2025)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
por: Liang, Yujia, et al.
Publicado: (2025)
por: Liang, Yujia, et al.
Publicado: (2025)
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
por: Chen, Jiabin, et al.
Publicado: (2025)
por: Chen, Jiabin, et al.
Publicado: (2025)
Multi-modal Relation Distillation for Unified 3D Representation Learning
por: Wang, Huiqun, et al.
Publicado: (2024)
por: Wang, Huiqun, et al.
Publicado: (2024)
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
por: Xuan, Shiyu, et al.
Publicado: (2023)
por: Xuan, Shiyu, et al.
Publicado: (2023)
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
por: Wu, Haoning, et al.
Publicado: (2025)
por: Wu, Haoning, et al.
Publicado: (2025)
AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation
por: Jiang, Xi, et al.
Publicado: (2026)
por: Jiang, Xi, et al.
Publicado: (2026)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark
por: Li, Qi, et al.
Publicado: (2026)
por: Li, Qi, et al.
Publicado: (2026)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
por: Liu, Chonghan, et al.
Publicado: (2025)
por: Liu, Chonghan, et al.
Publicado: (2025)
Towards a Universal 3D Medical Multi-modality Generalization via Learning Personalized Invariant Representation
por: Tan, Zhaorui, et al.
Publicado: (2024)
por: Tan, Zhaorui, et al.
Publicado: (2024)
XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation
por: Wang, Ziyi, et al.
Publicado: (2024)
por: Wang, Ziyi, et al.
Publicado: (2024)
A Comprehensive Survey on 3D Content Generation
por: Liu, Jian, et al.
Publicado: (2024)
por: Liu, Jian, et al.
Publicado: (2024)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
por: Dai, Ming, et al.
Publicado: (2024)
por: Dai, Ming, et al.
Publicado: (2024)
A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights
por: Lei, Wentao, et al.
Publicado: (2024)
por: Lei, Wentao, et al.
Publicado: (2024)
Multi-modal Auto-regressive Modeling via Visual Words
por: Peng, Tianshuo, et al.
Publicado: (2024)
por: Peng, Tianshuo, et al.
Publicado: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
por: Wang, Xiao, et al.
Publicado: (2023)
por: Wang, Xiao, et al.
Publicado: (2023)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
por: Yazdani, Shamim, et al.
Publicado: (2025)
por: Yazdani, Shamim, et al.
Publicado: (2025)
TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness
por: Chen, Mu, et al.
Publicado: (2025)
por: Chen, Mu, et al.
Publicado: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
por: Feng, Jie, et al.
Publicado: (2025)
por: Feng, Jie, et al.
Publicado: (2025)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
por: Liao, Pan, et al.
Publicado: (2026)
por: Liao, Pan, et al.
Publicado: (2026)
Awesome Multi-modal Object Tracking
por: Zhang, Chunhui, et al.
Publicado: (2024)
por: Zhang, Chunhui, et al.
Publicado: (2024)
OpenClaw-RL: Train Any Agent Simply by Talking
por: Wang, Yinjie, et al.
Publicado: (2026)
por: Wang, Yinjie, et al.
Publicado: (2026)
ImagebindDC: Compressing Multi-modal Data with Imagebind-based Condensation
por: Min, Yue, et al.
Publicado: (2025)
por: Min, Yue, et al.
Publicado: (2025)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
por: Mo, Wentao, et al.
Publicado: (2026)
por: Mo, Wentao, et al.
Publicado: (2026)
Evaluating Adversarial Protections for Diffusion Personalization: A Comprehensive Study
por: Ye, Kai, et al.
Publicado: (2025)
por: Ye, Kai, et al.
Publicado: (2025)
Advances in 3D Neural Stylization: A Survey
por: Chen, Yingshu, et al.
Publicado: (2023)
por: Chen, Yingshu, et al.
Publicado: (2023)
A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
por: Ma, Guozheng, et al.
Publicado: (2022)
por: Ma, Guozheng, et al.
Publicado: (2022)
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
por: Mou, Tingshu, et al.
Publicado: (2026)
por: Mou, Tingshu, et al.
Publicado: (2026)
AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis
por: He, Shidan, et al.
Publicado: (2024)
por: He, Shidan, et al.
Publicado: (2024)
Robust Domain Generalization for Multi-modal Object Recognition
por: Qiao, Yuxin, et al.
Publicado: (2024)
por: Qiao, Yuxin, et al.
Publicado: (2024)
GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting
por: Yao, Lei, et al.
Publicado: (2025)
por: Yao, Lei, et al.
Publicado: (2025)
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
por: Xing, Yifei, et al.
Publicado: (2024)
por: Xing, Yifei, et al.
Publicado: (2024)
OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
por: Chen, Zhihong, et al.
Publicado: (2025)
por: Chen, Zhihong, et al.
Publicado: (2025)
Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy
por: Yang, Yiting, et al.
Publicado: (2025)
por: Yang, Yiting, et al.
Publicado: (2025)
A Survey on 3D Gaussian Splatting
por: Chen, Guikun, et al.
Publicado: (2024)
por: Chen, Guikun, et al.
Publicado: (2024)
Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting
por: Miao, Xingyu, et al.
Publicado: (2025)
por: Miao, Xingyu, et al.
Publicado: (2025)
C4D: 4D Made from 3D through Dual Correspondences
por: Wang, Shizun, et al.
Publicado: (2025)
por: Wang, Shizun, et al.
Publicado: (2025)
Ejemplares similares
-
Training-free Dense-Aligned Diffusion Guidance for Modular Conditional Image Synthesis
por: Wang, Zixuan, et al.
Publicado: (2025) -
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
por: Liang, Yujia, et al.
Publicado: (2025) -
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
por: Chen, Jiabin, et al.
Publicado: (2025) -
Multi-modal Relation Distillation for Unified 3D Representation Learning
por: Wang, Huiqun, et al.
Publicado: (2024) -
Vision-Language Navigation with Embodied Intelligence: A Survey
por: Gao, Peng, et al.
Publicado: (2024)