VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Kelly, Chris, Hu, Luhui, Hu, Jiayin, Tian, Yu, Yang, Deshun, Yang, Bang, Yang, Cindy, Li, Zihao, Huang, Zaoshan, Zou, Yuexian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
por: Kelly, Chris, et al.
Publicado: (2024)
por: Kelly, Chris, et al.
Publicado: (2024)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
por: Yang, Deshun, et al.
Publicado: (2024)
por: Yang, Deshun, et al.
Publicado: (2024)
HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
por: Bian, Zixuan, et al.
Publicado: (2025)
por: Bian, Zixuan, et al.
Publicado: (2025)
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models
por: Huang, Ian, et al.
Publicado: (2024)
por: Huang, Ian, et al.
Publicado: (2024)
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
por: Chen, Dong-Yu, et al.
Publicado: (2026)
por: Chen, Dong-Yu, et al.
Publicado: (2026)
3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds
por: Sun, Fan-Yun, et al.
Publicado: (2025)
por: Sun, Fan-Yun, et al.
Publicado: (2025)
Multimodal 3D Few‐Shot Classification via Gaussian Mixture Discriminant Analysis
por: Yiqi Wu, et al.
Publicado: (2025)
por: Yiqi Wu, et al.
Publicado: (2025)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
por: Wang, Yuze, et al.
Publicado: (2025)
por: Wang, Yuze, et al.
Publicado: (2025)
TopoGen: Topology‐Aware 3D Generation with Persistence Points
por: Jiangbei Hu, et al.
Publicado: (2025)
por: Jiangbei Hu, et al.
Publicado: (2025)
FilmAgent: A Multi-Agent Framework for End-to-End Film Automation in Virtual 3D Spaces
por: Xu, Zhenran, et al.
Publicado: (2025)
por: Xu, Zhenran, et al.
Publicado: (2025)
3DGSR: Implicit Surface Reconstruction with 3D Gaussian Splatting
por: Lyu, Xiaoyang, et al.
Publicado: (2024)
por: Lyu, Xiaoyang, et al.
Publicado: (2024)
Edit360: 2D Image Edits to 3D Assets from Any Angle
por: Huang, Junchao, et al.
Publicado: (2025)
por: Huang, Junchao, et al.
Publicado: (2025)
High-Speed Dynamic 3D Imaging with Sensor Fusion Splatting
por: Zou, Zihao, et al.
Publicado: (2025)
por: Zou, Zihao, et al.
Publicado: (2025)
Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D Strokes
por: Duan, Hao-Bin, et al.
Publicado: (2023)
por: Duan, Hao-Bin, et al.
Publicado: (2023)
ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation
por: Sun, Hanxiao, et al.
Publicado: (2026)
por: Sun, Hanxiao, et al.
Publicado: (2026)
MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
por: Fang, Shuangkang, et al.
Publicado: (2025)
por: Fang, Shuangkang, et al.
Publicado: (2025)
LassoNet: Deep Lasso-Selection of 3D Point Clouds
por: Zhu-Tian, Chen, et al.
Publicado: (2019)
por: Zhu-Tian, Chen, et al.
Publicado: (2019)
GS‐Octree: Octree‐based 3D Gaussian Splatting for Robust Object‐level 3D Reconstruction Under Strong Lighting
por: J. Li, et al.
Publicado: (2024)
por: J. Li, et al.
Publicado: (2024)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
por: Dong, Wenqi, et al.
Publicado: (2025)
por: Dong, Wenqi, et al.
Publicado: (2025)
Adaptive Spatio‐Temporal 3D Gaussian Splatting for Scenes with Oscillatory Motion
por: Petros Tzathas, et al.
Publicado: (2026)
por: Petros Tzathas, et al.
Publicado: (2026)
LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors
por: Chen, Yabo, et al.
Publicado: (2024)
por: Chen, Yabo, et al.
Publicado: (2024)
Matrix-3D: Omnidirectional Explorable 3D World Generation
por: Yang, Zhongqi, et al.
Publicado: (2025)
por: Yang, Zhongqi, et al.
Publicado: (2025)
3D Human Face Reconstruction with 3DMM face model from RGB image
por: Jiang, Zhangnan, et al.
Publicado: (2026)
por: Jiang, Zhangnan, et al.
Publicado: (2026)
Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations
por: Guo, Ruoxi, et al.
Publicado: (2024)
por: Guo, Ruoxi, et al.
Publicado: (2024)
PEGAsus: 3D Personalization of Geometry and Appearance
por: Hu, Jingyu, et al.
Publicado: (2026)
por: Hu, Jingyu, et al.
Publicado: (2026)
Text‐Guided Diffusion with Spectral Convolution for 3D Human Pose Estimation
por: Liyuan Shi, et al.
Publicado: (2025)
por: Liyuan Shi, et al.
Publicado: (2025)
Vision6D: 3D-to-2D Interactive Visualization and Annotation Tool for 6D Pose Estimation
por: Zhang, Yike, et al.
Publicado: (2025)
por: Zhang, Yike, et al.
Publicado: (2025)
Unsupervised Cross-Domain Regression for Fine-grained 3D Game Character Reconstruction
por: Wen, Qi, et al.
Publicado: (2024)
por: Wen, Qi, et al.
Publicado: (2024)
3D-GPT: Procedural 3D Modeling with Large Language Models
por: Sun, Chunyi, et al.
Publicado: (2023)
por: Sun, Chunyi, et al.
Publicado: (2023)
WorldGrow: Generating Infinite 3D World
por: Li, Sikuang, et al.
Publicado: (2025)
por: Li, Sikuang, et al.
Publicado: (2025)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
por: Chen, Tianrun, et al.
Publicado: (2024)
por: Chen, Tianrun, et al.
Publicado: (2024)
MVD$^2$: Efficient Multiview 3D Reconstruction for Multiview Diffusion
por: Zheng, Xin-Yang, et al.
Publicado: (2024)
por: Zheng, Xin-Yang, et al.
Publicado: (2024)
AniGen: Unified $S^3$ Fields for Animatable 3D Asset Generation
por: Huang, Yi-Hua, et al.
Publicado: (2026)
por: Huang, Yi-Hua, et al.
Publicado: (2026)
THGS: Lifelike Talking Human Avatar Synthesis From Monocular Video Via 3D Gaussian Splatting
por: Chuang Chen, et al.
Publicado: (2025)
por: Chuang Chen, et al.
Publicado: (2025)
Coin3D: Controllable and Interactive 3D Assets Generation with Proxy-Guided Conditioning
por: Dong, Wenqi, et al.
Publicado: (2024)
por: Dong, Wenqi, et al.
Publicado: (2024)
Scalable and High-Quality Neural Implicit Representation for 3D Reconstruction
por: Yang, Leyuan, et al.
Publicado: (2025)
por: Yang, Leyuan, et al.
Publicado: (2025)
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
por: Yin, Shaofeng, et al.
Publicado: (2026)
por: Yin, Shaofeng, et al.
Publicado: (2026)
FSH3D: 3D Representation via Fibonacci Spherical Harmonics
por: Zikuan Li, et al.
Publicado: (2024)
por: Zikuan Li, et al.
Publicado: (2024)
ProGDF: Progressive Gaussian Differential Field for Controllable and Flexible 3D Editing
por: Zhao, Yian, et al.
Publicado: (2024)
por: Zhao, Yian, et al.
Publicado: (2024)
Multimodal Conditional 3D Face Geometry Generation
por: Otto, Christopher, et al.
Publicado: (2024)
por: Otto, Christopher, et al.
Publicado: (2024)
Ejemplares similares
-
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
por: Kelly, Chris, et al.
Publicado: (2024) -
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
por: Yang, Deshun, et al.
Publicado: (2024) -
HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
por: Bian, Zixuan, et al.
Publicado: (2025) -
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models
por: Huang, Ian, et al.
Publicado: (2024) -
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
por: Chen, Dong-Yu, et al.
Publicado: (2026)