SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Huang-Menders, Alexander, Liu, Xinhang, Xu, Andy, Zhang, Yuyao, Tang, Chi-Keung, Tai, Yu-Wing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multimodal Generation of Animatable 3D Human Models with AvatarForge
by: Liu, Xinhang, et al.
Published: (2025)
by: Liu, Xinhang, et al.
Published: (2025)
HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing
by: Zhang, Yuyao, et al.
Published: (2026)
by: Zhang, Yuyao, et al.
Published: (2026)
ChatCam: Empowering Camera Control through Conversational AI
by: Liu, Xinhang, et al.
Published: (2024)
by: Liu, Xinhang, et al.
Published: (2024)
WorldCraft: Photo-Realistic 3D World Creation and Customization via LLM Agents
by: Liu, Xinhang, et al.
Published: (2025)
by: Liu, Xinhang, et al.
Published: (2025)
Agentic 3D Scene Generation with Spatially Contextualized VLMs
by: Liu, Xinhang, et al.
Published: (2025)
by: Liu, Xinhang, et al.
Published: (2025)
InceptionHuman: Controllable Prompt-to-NeRF for Photorealistic 3D Human Generation
by: Kao, Shiu-hong, et al.
Published: (2023)
by: Kao, Shiu-hong, et al.
Published: (2023)
Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs
by: Wu, Qi, et al.
Published: (2024)
by: Wu, Qi, et al.
Published: (2024)
InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation
by: Wang, Yuchi, et al.
Published: (2024)
by: Wang, Yuchi, et al.
Published: (2024)
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
by: Wang, Zixuan, et al.
Published: (2024)
by: Wang, Zixuan, et al.
Published: (2024)
Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction
by: Liu, Xinhang, et al.
Published: (2023)
by: Liu, Xinhang, et al.
Published: (2023)
VP-LLM: Text-Driven 3D Volume Completion with Large Language Models through Patchification
by: Liu, Jianmeng, et al.
Published: (2024)
by: Liu, Jianmeng, et al.
Published: (2024)
UltraGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
by: Zhang, Yuyao, et al.
Published: (2025)
by: Zhang, Yuyao, et al.
Published: (2025)
ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation
by: Wang, Zixuan, et al.
Published: (2025)
by: Wang, Zixuan, et al.
Published: (2025)
FED-NeRF: Achieve High 3D Consistency and Temporal Coherence for Face Video Editing on Dynamic NeRF
by: Zhang, Hao, et al.
Published: (2024)
by: Zhang, Hao, et al.
Published: (2024)
ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation
by: Ao, Yuzhuo, et al.
Published: (2026)
by: Ao, Yuzhuo, et al.
Published: (2026)
Motion Avatar: Generate Human and Animal Avatars with Arbitrary Motion
by: Zhang, Zeyu, et al.
Published: (2024)
by: Zhang, Zeyu, et al.
Published: (2024)
Gear-NeRF: Free-Viewpoint Rendering and Tracking with Motion-aware Spatio-Temporal Sampling
by: Liu, Xinhang, et al.
Published: (2024)
by: Liu, Xinhang, et al.
Published: (2024)
Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts
by: Kao, Shiu-hong, et al.
Published: (2025)
by: Kao, Shiu-hong, et al.
Published: (2025)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
by: Kao, Shiu-hong, et al.
Published: (2025)
by: Kao, Shiu-hong, et al.
Published: (2025)
Text2Avatar: Text to 3D Human Avatar Generation with Codebook-Driven Body Controllable Attribute
by: Gong, Chaoqun, et al.
Published: (2024)
by: Gong, Chaoqun, et al.
Published: (2024)
DreamBarbie: Text to Barbie-Style 3D Avatars
by: Sun, Xiaokun, et al.
Published: (2024)
by: Sun, Xiaokun, et al.
Published: (2024)
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
by: Zhang, Youliang, et al.
Published: (2026)
by: Zhang, Youliang, et al.
Published: (2026)
Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning
by: Zhao, Yubo, et al.
Published: (2025)
by: Zhao, Yubo, et al.
Published: (2025)
SANeRF-HQ: Segment Anything for NeRF in High Quality
by: Liu, Yichen, et al.
Published: (2023)
by: Liu, Yichen, et al.
Published: (2023)
Trace Anything: Representing Any Video in 4D via Trajectory Fields
by: Liu, Xinhang, et al.
Published: (2025)
by: Liu, Xinhang, et al.
Published: (2025)
Inpaint4DNeRF: Promptable Spatio-Temporal NeRF Inpainting with Generative Diffusion Models
by: Jiang, Han, et al.
Published: (2023)
by: Jiang, Han, et al.
Published: (2023)
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
by: Tu, Shuyuan, et al.
Published: (2025)
by: Tu, Shuyuan, et al.
Published: (2025)
AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling
by: Mai, Ziyang, et al.
Published: (2026)
by: Mai, Ziyang, et al.
Published: (2026)
NoPo-Avatar: Generalizable and Animatable Avatars from Sparse Inputs without Human Poses
by: Wen, Jing, et al.
Published: (2025)
by: Wen, Jing, et al.
Published: (2025)
STG-Avatar: Animatable Human Avatars via Spacetime Gaussian
by: Jiang, Guangan, et al.
Published: (2025)
by: Jiang, Guangan, et al.
Published: (2025)
StrandHead: Text to Hair-Disentangled 3D Head Avatars Using Human-Centric Priors
by: Sun, Xiaokun, et al.
Published: (2024)
by: Sun, Xiaokun, et al.
Published: (2024)
Disentangled Clothed Avatar Generation from Text Descriptions
by: Wang, Jionghao, et al.
Published: (2023)
by: Wang, Jionghao, et al.
Published: (2023)
PiG-Avatar: Hierarchical Neural-Field-Guided Gaussian Avatars
by: Kaltheuner, Julian, et al.
Published: (2026)
by: Kaltheuner, Julian, et al.
Published: (2026)
NECA: Neural Customizable Human Avatar
by: Xiao, Junjin, et al.
Published: (2024)
by: Xiao, Junjin, et al.
Published: (2024)
R3-Avatar: Record and Retrieve Temporal Codebook for Reconstructing Photorealistic Human Avatars
by: Zhan, Yifan, et al.
Published: (2025)
by: Zhan, Yifan, et al.
Published: (2025)
One2Avatar: Generative Implicit Head Avatar For Few-shot User Adaptation
by: Yu, Zhixuan, et al.
Published: (2024)
by: Yu, Zhixuan, et al.
Published: (2024)
Hyper Diffusion Avatars: Dynamic Human Avatar Generation using Network Weight Space Diffusion
by: Cao, Dongliang, et al.
Published: (2025)
by: Cao, Dongliang, et al.
Published: (2025)
SplattingAvatar: Realistic Real-Time Human Avatars with Mesh-Embedded Gaussian Splatting
by: Shao, Zhijing, et al.
Published: (2024)
by: Shao, Zhijing, et al.
Published: (2024)
InvertAvatar: Incremental GAN Inversion for Generalized Head Avatars
by: Zhao, Xiaochen, et al.
Published: (2023)
by: Zhao, Xiaochen, et al.
Published: (2023)
AMG: Avatar Motion Guided Video Generation
by: Yang, Zhangsihao, et al.
Published: (2024)
by: Yang, Zhangsihao, et al.
Published: (2024)
Similar Items
-
Multimodal Generation of Animatable 3D Human Models with AvatarForge
by: Liu, Xinhang, et al.
Published: (2025) -
HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing
by: Zhang, Yuyao, et al.
Published: (2026) -
ChatCam: Empowering Camera Control through Conversational AI
by: Liu, Xinhang, et al.
Published: (2024) -
WorldCraft: Photo-Realistic 3D World Creation and Customization via LLM Agents
by: Liu, Xinhang, et al.
Published: (2025) -
Agentic 3D Scene Generation with Spatially Contextualized VLMs
by: Liu, Xinhang, et al.
Published: (2025)