VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Kelly, Chris, Hu, Luhui, Hu, Jiayin, Tian, Yu, Yang, Deshun, Yang, Bang, Yang, Cindy, Li, Zihao, Huang, Zaoshan, Zou, Yuexian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
di: Kelly, Chris, et al.
Pubblicazione: (2024)
di: Kelly, Chris, et al.
Pubblicazione: (2024)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
di: Yang, Deshun, et al.
Pubblicazione: (2024)
di: Yang, Deshun, et al.
Pubblicazione: (2024)
HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
di: Bian, Zixuan, et al.
Pubblicazione: (2025)
di: Bian, Zixuan, et al.
Pubblicazione: (2025)
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models
di: Huang, Ian, et al.
Pubblicazione: (2024)
di: Huang, Ian, et al.
Pubblicazione: (2024)
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
di: Chen, Dong-Yu, et al.
Pubblicazione: (2026)
di: Chen, Dong-Yu, et al.
Pubblicazione: (2026)
3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds
di: Sun, Fan-Yun, et al.
Pubblicazione: (2025)
di: Sun, Fan-Yun, et al.
Pubblicazione: (2025)
Multimodal 3D Few‐Shot Classification via Gaussian Mixture Discriminant Analysis
di: Yiqi Wu, et al.
Pubblicazione: (2025)
di: Yiqi Wu, et al.
Pubblicazione: (2025)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
di: Wang, Yuze, et al.
Pubblicazione: (2025)
di: Wang, Yuze, et al.
Pubblicazione: (2025)
TopoGen: Topology‐Aware 3D Generation with Persistence Points
di: Jiangbei Hu, et al.
Pubblicazione: (2025)
di: Jiangbei Hu, et al.
Pubblicazione: (2025)
FilmAgent: A Multi-Agent Framework for End-to-End Film Automation in Virtual 3D Spaces
di: Xu, Zhenran, et al.
Pubblicazione: (2025)
di: Xu, Zhenran, et al.
Pubblicazione: (2025)
3DGSR: Implicit Surface Reconstruction with 3D Gaussian Splatting
di: Lyu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Lyu, Xiaoyang, et al.
Pubblicazione: (2024)
Edit360: 2D Image Edits to 3D Assets from Any Angle
di: Huang, Junchao, et al.
Pubblicazione: (2025)
di: Huang, Junchao, et al.
Pubblicazione: (2025)
High-Speed Dynamic 3D Imaging with Sensor Fusion Splatting
di: Zou, Zihao, et al.
Pubblicazione: (2025)
di: Zou, Zihao, et al.
Pubblicazione: (2025)
Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D Strokes
di: Duan, Hao-Bin, et al.
Pubblicazione: (2023)
di: Duan, Hao-Bin, et al.
Pubblicazione: (2023)
ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation
di: Sun, Hanxiao, et al.
Pubblicazione: (2026)
di: Sun, Hanxiao, et al.
Pubblicazione: (2026)
MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
di: Fang, Shuangkang, et al.
Pubblicazione: (2025)
di: Fang, Shuangkang, et al.
Pubblicazione: (2025)
LassoNet: Deep Lasso-Selection of 3D Point Clouds
di: Zhu-Tian, Chen, et al.
Pubblicazione: (2019)
di: Zhu-Tian, Chen, et al.
Pubblicazione: (2019)
GS‐Octree: Octree‐based 3D Gaussian Splatting for Robust Object‐level 3D Reconstruction Under Strong Lighting
di: J. Li, et al.
Pubblicazione: (2024)
di: J. Li, et al.
Pubblicazione: (2024)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
di: Dong, Wenqi, et al.
Pubblicazione: (2025)
di: Dong, Wenqi, et al.
Pubblicazione: (2025)
Adaptive Spatio‐Temporal 3D Gaussian Splatting for Scenes with Oscillatory Motion
di: Petros Tzathas, et al.
Pubblicazione: (2026)
di: Petros Tzathas, et al.
Pubblicazione: (2026)
LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors
di: Chen, Yabo, et al.
Pubblicazione: (2024)
di: Chen, Yabo, et al.
Pubblicazione: (2024)
Matrix-3D: Omnidirectional Explorable 3D World Generation
di: Yang, Zhongqi, et al.
Pubblicazione: (2025)
di: Yang, Zhongqi, et al.
Pubblicazione: (2025)
3D Human Face Reconstruction with 3DMM face model from RGB image
di: Jiang, Zhangnan, et al.
Pubblicazione: (2026)
di: Jiang, Zhangnan, et al.
Pubblicazione: (2026)
Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations
di: Guo, Ruoxi, et al.
Pubblicazione: (2024)
di: Guo, Ruoxi, et al.
Pubblicazione: (2024)
PEGAsus: 3D Personalization of Geometry and Appearance
di: Hu, Jingyu, et al.
Pubblicazione: (2026)
di: Hu, Jingyu, et al.
Pubblicazione: (2026)
Text‐Guided Diffusion with Spectral Convolution for 3D Human Pose Estimation
di: Liyuan Shi, et al.
Pubblicazione: (2025)
di: Liyuan Shi, et al.
Pubblicazione: (2025)
Vision6D: 3D-to-2D Interactive Visualization and Annotation Tool for 6D Pose Estimation
di: Zhang, Yike, et al.
Pubblicazione: (2025)
di: Zhang, Yike, et al.
Pubblicazione: (2025)
Unsupervised Cross-Domain Regression for Fine-grained 3D Game Character Reconstruction
di: Wen, Qi, et al.
Pubblicazione: (2024)
di: Wen, Qi, et al.
Pubblicazione: (2024)
3D-GPT: Procedural 3D Modeling with Large Language Models
di: Sun, Chunyi, et al.
Pubblicazione: (2023)
di: Sun, Chunyi, et al.
Pubblicazione: (2023)
WorldGrow: Generating Infinite 3D World
di: Li, Sikuang, et al.
Pubblicazione: (2025)
di: Li, Sikuang, et al.
Pubblicazione: (2025)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
MVD$^2$: Efficient Multiview 3D Reconstruction for Multiview Diffusion
di: Zheng, Xin-Yang, et al.
Pubblicazione: (2024)
di: Zheng, Xin-Yang, et al.
Pubblicazione: (2024)
AniGen: Unified $S^3$ Fields for Animatable 3D Asset Generation
di: Huang, Yi-Hua, et al.
Pubblicazione: (2026)
di: Huang, Yi-Hua, et al.
Pubblicazione: (2026)
THGS: Lifelike Talking Human Avatar Synthesis From Monocular Video Via 3D Gaussian Splatting
di: Chuang Chen, et al.
Pubblicazione: (2025)
di: Chuang Chen, et al.
Pubblicazione: (2025)
Coin3D: Controllable and Interactive 3D Assets Generation with Proxy-Guided Conditioning
di: Dong, Wenqi, et al.
Pubblicazione: (2024)
di: Dong, Wenqi, et al.
Pubblicazione: (2024)
Scalable and High-Quality Neural Implicit Representation for 3D Reconstruction
di: Yang, Leyuan, et al.
Pubblicazione: (2025)
di: Yang, Leyuan, et al.
Pubblicazione: (2025)
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
di: Yin, Shaofeng, et al.
Pubblicazione: (2026)
di: Yin, Shaofeng, et al.
Pubblicazione: (2026)
FSH3D: 3D Representation via Fibonacci Spherical Harmonics
di: Zikuan Li, et al.
Pubblicazione: (2024)
di: Zikuan Li, et al.
Pubblicazione: (2024)
ProGDF: Progressive Gaussian Differential Field for Controllable and Flexible 3D Editing
di: Zhao, Yian, et al.
Pubblicazione: (2024)
di: Zhao, Yian, et al.
Pubblicazione: (2024)
Multimodal Conditional 3D Face Geometry Generation
di: Otto, Christopher, et al.
Pubblicazione: (2024)
di: Otto, Christopher, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
di: Kelly, Chris, et al.
Pubblicazione: (2024) -
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
di: Yang, Deshun, et al.
Pubblicazione: (2024) -
HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
di: Bian, Zixuan, et al.
Pubblicazione: (2025) -
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models
di: Huang, Ian, et al.
Pubblicazione: (2024) -
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
di: Chen, Dong-Yu, et al.
Pubblicazione: (2026)