Takin-ADA: Emotion Controllable Audio-Driven Animation with Canonical and Landmark Loss Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Bin, Yu, Yanzhen, Ye, Jianhao, Lv, Ruitao, Yang, Yuguang, Xie, Ruoye, Yu, Pan, Zhou, Hongbin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models
par: Chen, Sijing, et autres
Publié: (2024)
par: Chen, Sijing, et autres
Publié: (2024)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
par: Yang, Yuguang, et autres
Publié: (2024)
par: Yang, Yuguang, et autres
Publié: (2024)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
EmoFace: Audio-driven Emotional 3D Face Animation
par: Liu, Chang, et autres
Publié: (2024)
par: Liu, Chang, et autres
Publié: (2024)
ESGaussianFace: Emotional and Stylized Audio-Driven Facial Animation via 3D Gaussian Splatting
par: Ma, Chuhang, et autres
Publié: (2026)
par: Ma, Chuhang, et autres
Publié: (2026)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions
par: Chen, Zhiyuan, et autres
Publié: (2024)
par: Chen, Zhiyuan, et autres
Publié: (2024)
PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders
par: Pan, Yu, et autres
Publié: (2024)
par: Pan, Yu, et autres
Publié: (2024)
MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation
par: Liu, Huaize, et autres
Publié: (2025)
par: Liu, Huaize, et autres
Publié: (2025)
LinguaLinker: Audio-Driven Portraits Animation with Implicit Facial Control Enhancement
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
Identity-Preserving Pose-Guided Character Animation via Facial Landmarks Transformation
par: Mu, Lianrui, et autres
Publié: (2024)
par: Mu, Lianrui, et autres
Publié: (2024)
Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding
par: Zhang, Yuhui, et autres
Publié: (2026)
par: Zhang, Yuhui, et autres
Publié: (2026)
Morphological Study on the Coat Hair in Golden Takin
par: Yutaka Kawahara, et autres
Publié: (2025)
par: Yutaka Kawahara, et autres
Publié: (2025)
MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Isolation and Characterization of Mesenchymal Stem Cells Derived From the Bone Marrow of Takin ( Budorcas taxicolor )
par: Wei‐Qiang Luo, et autres
Publié: (2025)
par: Wei‐Qiang Luo, et autres
Publié: (2025)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Audio-Synchronized Visual Animation
par: Zhang, Lin, et autres
Publié: (2024)
par: Zhang, Lin, et autres
Publié: (2024)
Audiobook-CC: Controllable Long-context Speech Generation for Multicast Audiobook
par: Liu, Min, et autres
Publié: (2025)
par: Liu, Min, et autres
Publié: (2025)
Content and Style Aware Audio-Driven Facial Animation
par: Liu, Qingju, et autres
Publié: (2024)
par: Liu, Qingju, et autres
Publié: (2024)
DiffPoseTalk: Speech-Driven Stylistic 3D Facial Animation and Head Pose Generation via Diffusion Models
par: Sun, Zhiyao, et autres
Publié: (2023)
par: Sun, Zhiyao, et autres
Publié: (2023)
PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation
par: Wang, Baiqin, et autres
Publié: (2025)
par: Wang, Baiqin, et autres
Publié: (2025)
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation
par: Xu, Zhihua, et autres
Publié: (2025)
par: Xu, Zhihua, et autres
Publié: (2025)
DEEPTalk: Dynamic Emotion Embedding for Probabilistic Speech-Driven 3D Face Animation
par: Kim, Jisoo, et autres
Publié: (2024)
par: Kim, Jisoo, et autres
Publié: (2024)
ALIVE: Animate Your World with Lifelike Audio-Video Generation
par: Guo, Ying, et autres
Publié: (2026)
par: Guo, Ying, et autres
Publié: (2026)
FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation
par: Wang, MengChao, et autres
Publié: (2025)
par: Wang, MengChao, et autres
Publié: (2025)
Audio Driven Real-Time Facial Animation for Social Telepresence
par: Lee, Jiye, et autres
Publié: (2025)
par: Lee, Jiye, et autres
Publié: (2025)
AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation
par: Wei, Huawei, et autres
Publié: (2024)
par: Wei, Huawei, et autres
Publié: (2024)
Emergence of $π$ from Equatorial Quantum Localization
par: Ye, Bin, et autres
Publié: (2026)
par: Ye, Bin, et autres
Publié: (2026)
Quantum Realization of the Wallis Formula
par: Ye, Bin, et autres
Publié: (2026)
par: Ye, Bin, et autres
Publié: (2026)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
par: Sha, Xuanmeng, et autres
Publié: (2024)
par: Sha, Xuanmeng, et autres
Publié: (2024)
Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning
par: Xie, Yifan, et autres
Publié: (2025)
par: Xie, Yifan, et autres
Publié: (2025)
KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation
par: Vo-Thanh, Hoang-Son, et autres
Publié: (2024)
par: Vo-Thanh, Hoang-Son, et autres
Publié: (2024)
PESTalk: Speech-Driven 3D Facial Animation with Personalized Emotional Styles
par: Han, Tianshun, et autres
Publié: (2025)
par: Han, Tianshun, et autres
Publié: (2025)
Enhancing Speech-Driven 3D Facial Animation with Audio-Visual Guidance from Lip Reading Expert
par: EunGi, Han, et autres
Publié: (2024)
par: EunGi, Han, et autres
Publié: (2024)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2024)
par: Pan, Yu, et autres
Publié: (2024)
EmotionGesture: Audio-Driven Diverse Emotional Co-Speech 3D Gesture Generation
par: Qi, Xingqun, et autres
Publié: (2023)
par: Qi, Xingqun, et autres
Publié: (2023)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation
par: Cui, Jiahao, et autres
Publié: (2024)
par: Cui, Jiahao, et autres
Publié: (2024)
Documents similaires
-
Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models
par: Chen, Sijing, et autres
Publié: (2024) -
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
par: Yang, Yuguang, et autres
Publié: (2024) -
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
par: Pan, Yu, et autres
Publié: (2025) -
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
par: Yao, Jixun, et autres
Publié: (2025) -
EmoFace: Audio-driven Emotional 3D Face Animation
par: Liu, Chang, et autres
Publié: (2024)