Talking Together: Synthesizing Co-Located 3D Conversations from Audio
Fuente:
arXiv
Guardado en:
| Autores principales: | Shan, Mengyi, Chang, Shouchieh, Bai, Ziqian, Liu, Shichen, Zhang, Yinda, Song, Luchuan, Pandey, Rohit, Fanello, Sean, Huang, Zeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient 3D Implicit Head Avatar with Mesh-anchored Hash Table Blendshapes
por: Bai, Ziqian, et al.
Publicado: (2024)
por: Bai, Ziqian, et al.
Publicado: (2024)
IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos
por: Li, Yuan, et al.
Publicado: (2025)
por: Li, Yuan, et al.
Publicado: (2025)
LightAvatar: Efficient Head Avatar as Dynamic Neural Light Field
por: Wang, Huan, et al.
Publicado: (2024)
por: Wang, Huan, et al.
Publicado: (2024)
One2Avatar: Generative Implicit Head Avatar For Few-shot User Adaptation
por: Yu, Zhixuan, et al.
Publicado: (2024)
por: Yu, Zhixuan, et al.
Publicado: (2024)
Archon: A Unified Multimodal Model for Holistic Digital Human Generation
por: Bao, Chong, et al.
Publicado: (2026)
por: Bao, Chong, et al.
Publicado: (2026)
SVG: 3D Stereoscopic Video Generation via Denoising Frame Matrix
por: Dai, Peng, et al.
Publicado: (2024)
por: Dai, Peng, et al.
Publicado: (2024)
S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix
por: Dai, Peng, et al.
Publicado: (2025)
por: Dai, Peng, et al.
Publicado: (2025)
Adaptive Super Resolution For One-Shot Talking-Head Generation
por: Song, Luchuan, et al.
Publicado: (2024)
por: Song, Luchuan, et al.
Publicado: (2024)
From Audio to Photoreal Embodiment: Synthesizing Humans in Conversations
por: Ng, Evonne, et al.
Publicado: (2024)
por: Ng, Evonne, et al.
Publicado: (2024)
CHOSEN: Contrastive Hypothesis Selection for Multi-View Depth Refinement
por: Qiu, Di, et al.
Publicado: (2024)
por: Qiu, Di, et al.
Publicado: (2024)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
por: Weng, Yuzhe, et al.
Publicado: (2026)
por: Weng, Yuzhe, et al.
Publicado: (2026)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
por: Liu, Pinxin, et al.
Publicado: (2025)
por: Liu, Pinxin, et al.
Publicado: (2025)
Conditional Latent Coding with Learnable Synthesized Reference for Deep Image Compression
por: Wu, Siqi, et al.
Publicado: (2025)
por: Wu, Siqi, et al.
Publicado: (2025)
DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations
por: Peng, Ziqiao, et al.
Publicado: (2025)
por: Peng, Ziqiao, et al.
Publicado: (2025)
EgoRelight: Egocentric Human Capture and Illumination Recovery for Relightable and Photoreal Avatar Rendering
por: Chen, Jianchun, et al.
Publicado: (2026)
por: Chen, Jianchun, et al.
Publicado: (2026)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
por: Xie, Yifan, et al.
Publicado: (2024)
por: Xie, Yifan, et al.
Publicado: (2024)
AVI-Talking: Learning Audio-Visual Instructions for Expressive 3D Talking Face Generation
por: Sun, Yasheng, et al.
Publicado: (2024)
por: Sun, Yasheng, et al.
Publicado: (2024)
From Personas to Talks: Revisiting the Impact of Personas on LLM-Synthesized Emotional Support Conversations
por: Wu, Shenghan, et al.
Publicado: (2025)
por: Wu, Shenghan, et al.
Publicado: (2025)
GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian Splatting
por: Agarwal, Madhav, et al.
Publicado: (2025)
por: Agarwal, Madhav, et al.
Publicado: (2025)
An Unsupervised Domain Adaptation Method for Locating Manipulated Region in partially fake Audio
por: Zeng, Siding, et al.
Publicado: (2024)
por: Zeng, Siding, et al.
Publicado: (2024)
Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation
por: Kong, Zhe, et al.
Publicado: (2025)
por: Kong, Zhe, et al.
Publicado: (2025)
Supervising 3D Talking Head Avatars with Analysis-by-Audio-Synthesis
por: Daněček, Radek, et al.
Publicado: (2025)
por: Daněček, Radek, et al.
Publicado: (2025)
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
por: Wang, Qili, et al.
Publicado: (2025)
por: Wang, Qili, et al.
Publicado: (2025)
EgoAvatar: Egocentric View-Driven and Photorealistic Full-body Avatars
por: Chen, Jianchun, et al.
Publicado: (2024)
por: Chen, Jianchun, et al.
Publicado: (2024)
StreamME: Simplify 3D Gaussian Avatar within Live Stream
por: Song, Luchuan, et al.
Publicado: (2025)
por: Song, Luchuan, et al.
Publicado: (2025)
EmoGene: Audio-Driven Emotional 3D Talking-Head Generation
por: Wang, Wenqing, et al.
Publicado: (2024)
por: Wang, Wenqing, et al.
Publicado: (2024)
EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head
por: Liu, Chang, et al.
Publicado: (2025)
por: Liu, Chang, et al.
Publicado: (2025)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
por: Fei, Zhengcong, et al.
Publicado: (2025)
por: Fei, Zhengcong, et al.
Publicado: (2025)
OT-Talk: Animating 3D Talking Head with Optimal Transportation
por: Wang, Xinmu, et al.
Publicado: (2025)
por: Wang, Xinmu, et al.
Publicado: (2025)
EmoFace: Audio-driven Emotional 3D Face Animation
por: Liu, Chang, et al.
Publicado: (2024)
por: Liu, Chang, et al.
Publicado: (2024)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
por: Wang, Haotian, et al.
Publicado: (2024)
por: Wang, Haotian, et al.
Publicado: (2024)
ChatTracer: Large Language Model Powered Real-time Bluetooth Device Tracking System
por: Wang, Qijun, et al.
Publicado: (2024)
por: Wang, Qijun, et al.
Publicado: (2024)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
por: Ling, Jun, et al.
Publicado: (2024)
por: Ling, Jun, et al.
Publicado: (2024)
SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space
por: Zhang, Zeren, et al.
Publicado: (2024)
por: Zhang, Zeren, et al.
Publicado: (2024)
TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting
por: Li, Jiahe, et al.
Publicado: (2024)
por: Li, Jiahe, et al.
Publicado: (2024)
Amortized Inference for Model Rocket Aerodynamics: Learning to Estimate Physical Parameters from Simulation
por: Pandey, Rohit, et al.
Publicado: (2025)
por: Pandey, Rohit, et al.
Publicado: (2025)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
CoTracker: It is Better to Track Together
por: Karaev, Nikita, et al.
Publicado: (2023)
por: Karaev, Nikita, et al.
Publicado: (2023)
PortraitTalk: Towards Customizable One-Shot Audio-to-Talking Face Generation
por: Nazarieh, Fatemeh, et al.
Publicado: (2024)
por: Nazarieh, Fatemeh, et al.
Publicado: (2024)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
Ejemplares similares
-
Efficient 3D Implicit Head Avatar with Mesh-anchored Hash Table Blendshapes
por: Bai, Ziqian, et al.
Publicado: (2024) -
IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos
por: Li, Yuan, et al.
Publicado: (2025) -
LightAvatar: Efficient Head Avatar as Dynamic Neural Light Field
por: Wang, Huan, et al.
Publicado: (2024) -
One2Avatar: Generative Implicit Head Avatar For Few-shot User Adaptation
por: Yu, Zhixuan, et al.
Publicado: (2024) -
Archon: A Unified Multimodal Model for Holistic Digital Human Generation
por: Bao, Chong, et al.
Publicado: (2026)