VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kelly, Chris, Hu, Luhui, Hu, Jiayin, Tian, Yu, Yang, Deshun, Yang, Bang, Yang, Cindy, Li, Zihao, Huang, Zaoshan, Zou, Yuexian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
par: Kelly, Chris, et autres
Publié: (2024)
par: Kelly, Chris, et autres
Publié: (2024)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
par: Yang, Deshun, et autres
Publié: (2024)
par: Yang, Deshun, et autres
Publié: (2024)
HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
par: Bian, Zixuan, et autres
Publié: (2025)
par: Bian, Zixuan, et autres
Publié: (2025)
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models
par: Huang, Ian, et autres
Publié: (2024)
par: Huang, Ian, et autres
Publié: (2024)
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
par: Chen, Dong-Yu, et autres
Publié: (2026)
par: Chen, Dong-Yu, et autres
Publié: (2026)
3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds
par: Sun, Fan-Yun, et autres
Publié: (2025)
par: Sun, Fan-Yun, et autres
Publié: (2025)
Multimodal 3D Few‐Shot Classification via Gaussian Mixture Discriminant Analysis
par: Yiqi Wu, et autres
Publié: (2025)
par: Yiqi Wu, et autres
Publié: (2025)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
par: Wang, Yuze, et autres
Publié: (2025)
par: Wang, Yuze, et autres
Publié: (2025)
TopoGen: Topology‐Aware 3D Generation with Persistence Points
par: Jiangbei Hu, et autres
Publié: (2025)
par: Jiangbei Hu, et autres
Publié: (2025)
FilmAgent: A Multi-Agent Framework for End-to-End Film Automation in Virtual 3D Spaces
par: Xu, Zhenran, et autres
Publié: (2025)
par: Xu, Zhenran, et autres
Publié: (2025)
3DGSR: Implicit Surface Reconstruction with 3D Gaussian Splatting
par: Lyu, Xiaoyang, et autres
Publié: (2024)
par: Lyu, Xiaoyang, et autres
Publié: (2024)
Edit360: 2D Image Edits to 3D Assets from Any Angle
par: Huang, Junchao, et autres
Publié: (2025)
par: Huang, Junchao, et autres
Publié: (2025)
High-Speed Dynamic 3D Imaging with Sensor Fusion Splatting
par: Zou, Zihao, et autres
Publié: (2025)
par: Zou, Zihao, et autres
Publié: (2025)
Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D Strokes
par: Duan, Hao-Bin, et autres
Publié: (2023)
par: Duan, Hao-Bin, et autres
Publié: (2023)
ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation
par: Sun, Hanxiao, et autres
Publié: (2026)
par: Sun, Hanxiao, et autres
Publié: (2026)
MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
par: Fang, Shuangkang, et autres
Publié: (2025)
par: Fang, Shuangkang, et autres
Publié: (2025)
LassoNet: Deep Lasso-Selection of 3D Point Clouds
par: Zhu-Tian, Chen, et autres
Publié: (2019)
par: Zhu-Tian, Chen, et autres
Publié: (2019)
GS‐Octree: Octree‐based 3D Gaussian Splatting for Robust Object‐level 3D Reconstruction Under Strong Lighting
par: J. Li, et autres
Publié: (2024)
par: J. Li, et autres
Publié: (2024)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
par: Dong, Wenqi, et autres
Publié: (2025)
par: Dong, Wenqi, et autres
Publié: (2025)
Adaptive Spatio‐Temporal 3D Gaussian Splatting for Scenes with Oscillatory Motion
par: Petros Tzathas, et autres
Publié: (2026)
par: Petros Tzathas, et autres
Publié: (2026)
LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors
par: Chen, Yabo, et autres
Publié: (2024)
par: Chen, Yabo, et autres
Publié: (2024)
Matrix-3D: Omnidirectional Explorable 3D World Generation
par: Yang, Zhongqi, et autres
Publié: (2025)
par: Yang, Zhongqi, et autres
Publié: (2025)
3D Human Face Reconstruction with 3DMM face model from RGB image
par: Jiang, Zhangnan, et autres
Publié: (2026)
par: Jiang, Zhangnan, et autres
Publié: (2026)
Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations
par: Guo, Ruoxi, et autres
Publié: (2024)
par: Guo, Ruoxi, et autres
Publié: (2024)
PEGAsus: 3D Personalization of Geometry and Appearance
par: Hu, Jingyu, et autres
Publié: (2026)
par: Hu, Jingyu, et autres
Publié: (2026)
Text‐Guided Diffusion with Spectral Convolution for 3D Human Pose Estimation
par: Liyuan Shi, et autres
Publié: (2025)
par: Liyuan Shi, et autres
Publié: (2025)
Vision6D: 3D-to-2D Interactive Visualization and Annotation Tool for 6D Pose Estimation
par: Zhang, Yike, et autres
Publié: (2025)
par: Zhang, Yike, et autres
Publié: (2025)
Unsupervised Cross-Domain Regression for Fine-grained 3D Game Character Reconstruction
par: Wen, Qi, et autres
Publié: (2024)
par: Wen, Qi, et autres
Publié: (2024)
3D-GPT: Procedural 3D Modeling with Large Language Models
par: Sun, Chunyi, et autres
Publié: (2023)
par: Sun, Chunyi, et autres
Publié: (2023)
WorldGrow: Generating Infinite 3D World
par: Li, Sikuang, et autres
Publié: (2025)
par: Li, Sikuang, et autres
Publié: (2025)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
par: Chen, Tianrun, et autres
Publié: (2024)
par: Chen, Tianrun, et autres
Publié: (2024)
MVD$^2$: Efficient Multiview 3D Reconstruction for Multiview Diffusion
par: Zheng, Xin-Yang, et autres
Publié: (2024)
par: Zheng, Xin-Yang, et autres
Publié: (2024)
AniGen: Unified $S^3$ Fields for Animatable 3D Asset Generation
par: Huang, Yi-Hua, et autres
Publié: (2026)
par: Huang, Yi-Hua, et autres
Publié: (2026)
THGS: Lifelike Talking Human Avatar Synthesis From Monocular Video Via 3D Gaussian Splatting
par: Chuang Chen, et autres
Publié: (2025)
par: Chuang Chen, et autres
Publié: (2025)
Coin3D: Controllable and Interactive 3D Assets Generation with Proxy-Guided Conditioning
par: Dong, Wenqi, et autres
Publié: (2024)
par: Dong, Wenqi, et autres
Publié: (2024)
Scalable and High-Quality Neural Implicit Representation for 3D Reconstruction
par: Yang, Leyuan, et autres
Publié: (2025)
par: Yang, Leyuan, et autres
Publié: (2025)
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
par: Yin, Shaofeng, et autres
Publié: (2026)
par: Yin, Shaofeng, et autres
Publié: (2026)
FSH3D: 3D Representation via Fibonacci Spherical Harmonics
par: Zikuan Li, et autres
Publié: (2024)
par: Zikuan Li, et autres
Publié: (2024)
ProGDF: Progressive Gaussian Differential Field for Controllable and Flexible 3D Editing
par: Zhao, Yian, et autres
Publié: (2024)
par: Zhao, Yian, et autres
Publié: (2024)
Multimodal Conditional 3D Face Geometry Generation
par: Otto, Christopher, et autres
Publié: (2024)
par: Otto, Christopher, et autres
Publié: (2024)
Documents similaires
-
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
par: Kelly, Chris, et autres
Publié: (2024) -
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
par: Yang, Deshun, et autres
Publié: (2024) -
HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing
par: Bian, Zixuan, et autres
Publié: (2025) -
BlenderAlchemy: Editing 3D Graphics with Vision-Language Models
par: Huang, Ian, et autres
Publié: (2024) -
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
par: Chen, Dong-Yu, et autres
Publié: (2026)