Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Youliang, Zhou, Zhengguang, Yu, Zhentao, Huang, Ziyao, Hu, Teng, Liang, Sen, Zhang, Guozhen, Peng, Ziqiao, Li, Shunkai, Chen, Yi, Zhou, Zixiang, Zhou, Yuan, Lu, Qinglin, Li, Xiu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
by: Sun, Zhiyao, et al.
Published: (2025)
by: Sun, Zhiyao, et al.
Published: (2025)
ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars
by: Peng, Ziqiao, et al.
Published: (2025)
by: Peng, Ziqiao, et al.
Published: (2025)
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
by: Zhang, Guozhen, et al.
Published: (2025)
by: Zhang, Guozhen, et al.
Published: (2025)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
by: Chen, Yi, et al.
Published: (2025)
by: Chen, Yi, et al.
Published: (2025)
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
by: Hu, Teng, et al.
Published: (2025)
by: Hu, Teng, et al.
Published: (2025)
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
by: Hu, Teng, et al.
Published: (2025)
by: Hu, Teng, et al.
Published: (2025)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
by: Hu, Teng, et al.
Published: (2025)
by: Hu, Teng, et al.
Published: (2025)
Text2Avatar: Text to 3D Human Avatar Generation with Codebook-Driven Body Controllable Attribute
by: Gong, Chaoqun, et al.
Published: (2024)
by: Gong, Chaoqun, et al.
Published: (2024)
HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation
by: Huang, Ziyao, et al.
Published: (2025)
by: Huang, Ziyao, et al.
Published: (2025)
SentiAvatar: Towards Expressive and Interactive Digital Humans
by: Jin, Chuhao, et al.
Published: (2026)
by: Jin, Chuhao, et al.
Published: (2026)
RITA: A Real-time Interactive Talking Avatars Framework
by: Cheng, Wuxinlin, et al.
Published: (2024)
by: Cheng, Wuxinlin, et al.
Published: (2024)
Interactive Rendering of Relightable and Animatable Gaussian Avatars
by: Zhan, Youyi, et al.
Published: (2024)
by: Zhan, Youyi, et al.
Published: (2024)
Multimodal Priors-Augmented Text-Driven 3D Human-Object Interaction Generation
by: Wang, Yin, et al.
Published: (2026)
by: Wang, Yin, et al.
Published: (2026)
GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D Gaussians
by: Hu, Liangxiao, et al.
Published: (2023)
by: Hu, Liangxiao, et al.
Published: (2023)
STG-Avatar: Animatable Human Avatars via Spacetime Gaussian
by: Jiang, Guangan, et al.
Published: (2025)
by: Jiang, Guangan, et al.
Published: (2025)
InteractAvatar: Modeling Hand-Face Interaction in Photorealistic Avatars with Deformable Gaussians
by: Chen, Kefan, et al.
Published: (2025)
by: Chen, Kefan, et al.
Published: (2025)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
by: Liu, Xiangyu, et al.
Published: (2026)
by: Liu, Xiangyu, et al.
Published: (2026)
ConsistentAvatar: Learning to Diffuse Fully Consistent Talking Head Avatar with Temporal Guidance
by: Yang, Haijie, et al.
Published: (2024)
by: Yang, Haijie, et al.
Published: (2024)
Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation
by: Hong, Fa-Ting, et al.
Published: (2025)
by: Hong, Fa-Ting, et al.
Published: (2025)
SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents
by: Huang-Menders, Alexander, et al.
Published: (2025)
by: Huang-Menders, Alexander, et al.
Published: (2025)
Make-Your-Anchor: A Diffusion-based 2D Avatar Generation Framework
by: Huang, Ziyao, et al.
Published: (2024)
by: Huang, Ziyao, et al.
Published: (2024)
AvatarGO: Zero-shot 4D Human-Object Interaction Generation and Animation
by: Cao, Yukang, et al.
Published: (2024)
by: Cao, Yukang, et al.
Published: (2024)
TaoAvatar: Real-Time Lifelike Full-Body Talking Avatars for Augmented Reality via 3D Gaussian Splatting
by: Chen, Jianchuan, et al.
Published: (2025)
by: Chen, Jianchuan, et al.
Published: (2025)
Motion Avatar: Generate Human and Animal Avatars with Arbitrary Motion
by: Zhang, Zeyu, et al.
Published: (2024)
by: Zhang, Zeyu, et al.
Published: (2024)
OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
by: Liang, Sen, et al.
Published: (2025)
by: Liang, Sen, et al.
Published: (2025)
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation
by: Ki, Taekyung, et al.
Published: (2026)
by: Ki, Taekyung, et al.
Published: (2026)
RealityAvatar: Towards Realistic Loose Clothing Modeling in Animatable 3D Gaussian Avatars
by: Li, Yahui, et al.
Published: (2025)
by: Li, Yahui, et al.
Published: (2025)
Nods of Agreement: Webcam-Driven Avatars Improve Meeting Outcomes and Avatar Satisfaction Over Audio-Driven or Static Avatars in All-Avatar Work Videoconferencing
by: Ma, Fang, et al.
Published: (2024)
by: Ma, Fang, et al.
Published: (2024)
AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising
by: Cui, Liyuan, et al.
Published: (2026)
by: Cui, Liyuan, et al.
Published: (2026)
Controlling Avatar Diffusion with Learnable Gaussian Embedding
by: Gao, Xuan, et al.
Published: (2025)
by: Gao, Xuan, et al.
Published: (2025)
UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control
by: Sun, Wenzhang, et al.
Published: (2024)
by: Sun, Wenzhang, et al.
Published: (2024)
GAIA: Zero-shot Talking Avatar Generation
by: He, Tianyu, et al.
Published: (2023)
by: He, Tianyu, et al.
Published: (2023)
Generate Your Talking Avatar from Video Reference
by: Guo, Zujin, et al.
Published: (2026)
by: Guo, Zujin, et al.
Published: (2026)
VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization
by: Liu, Tao, et al.
Published: (2024)
by: Liu, Tao, et al.
Published: (2024)
Towards High-fidelity 3D Talking Avatar with Personalized Dynamic Texture
by: Li, Xuanchen, et al.
Published: (2025)
by: Li, Xuanchen, et al.
Published: (2025)
EgoAvatar: Egocentric View-Driven and Photorealistic Full-body Avatars
by: Chen, Jianchun, et al.
Published: (2024)
by: Chen, Jianchun, et al.
Published: (2024)
AvatarShield: Visual Reinforcement Learning for Human-Centric Synthetic Video Detection
by: Xu, Zhipei, et al.
Published: (2025)
by: Xu, Zhipei, et al.
Published: (2025)
AvatarPose: Avatar-guided 3D Pose Estimation of Close Human Interaction from Sparse Multi-view Videos
by: Lu, Feichi, et al.
Published: (2024)
by: Lu, Feichi, et al.
Published: (2024)
SplattingAvatar: Realistic Real-Time Human Avatars with Mesh-Embedded Gaussian Splatting
by: Shao, Zhijing, et al.
Published: (2024)
by: Shao, Zhijing, et al.
Published: (2024)
SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
by: Zhang, Youliang, et al.
Published: (2025)
by: Zhang, Youliang, et al.
Published: (2025)
Similar Items
-
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
by: Sun, Zhiyao, et al.
Published: (2025) -
ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars
by: Peng, Ziqiao, et al.
Published: (2025) -
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
by: Zhang, Guozhen, et al.
Published: (2025) -
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
by: Chen, Yi, et al.
Published: (2025) -
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
by: Hu, Teng, et al.
Published: (2025)