Learning to Generate Conditional Tri-plane for 3D-aware Expression Controllable Portrait Animation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ki, Taekyung, Min, Dongchan, Chae, Gyeongsu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait
par: Ki, Taekyung, et autres
Publié: (2024)
par: Ki, Taekyung, et autres
Publié: (2024)
StyleLipSync: Style-based Personalized Lip-sync Video Generation
par: Ki, Taekyung, et autres
Publié: (2023)
par: Ki, Taekyung, et autres
Publié: (2023)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
par: Tan, Weiting, et autres
Publié: (2026)
par: Tan, Weiting, et autres
Publié: (2026)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
par: Liu, Kangwei, et autres
Publié: (2025)
par: Liu, Kangwei, et autres
Publié: (2025)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
par: Qu, Qiang, et autres
Publié: (2025)
par: Qu, Qiang, et autres
Publié: (2025)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
par: Gan, Qijun, et autres
Publié: (2025)
par: Gan, Qijun, et autres
Publié: (2025)
Audio-visual Event Localization on Portrait Mode Short Videos
par: Liu, Wuyang, et autres
Publié: (2025)
par: Liu, Wuyang, et autres
Publié: (2025)
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation
par: Ki, Taekyung, et autres
Publié: (2026)
par: Ki, Taekyung, et autres
Publié: (2026)
Attributes-aware Visual Emotion Representation Learning
par: Maharjan, Rahul Singh, et autres
Publié: (2025)
par: Maharjan, Rahul Singh, et autres
Publié: (2025)
EditEmoTalk: Controllable Speech-Driven 3D Facial Animation with Continuous Expression Editing
par: Jiang, Diqiong, et autres
Publié: (2026)
par: Jiang, Diqiong, et autres
Publié: (2026)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
par: Zhang, Yuang, et autres
Publié: (2024)
par: Zhang, Yuang, et autres
Publié: (2024)
Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning
par: Wu, Ruiqi, et autres
Publié: (2024)
par: Wu, Ruiqi, et autres
Publié: (2024)
Instruction-Driven 3D Facial Expression Generation and Transition
par: Vo, Anh H., et autres
Publié: (2026)
par: Vo, Anh H., et autres
Publié: (2026)
KAN Text to Vision? The Exploration of Kolmogorov-Arnold Networks for Multi-Scale Sequence-Based Pose Animation from Sign Language Notation
par: Du, Guanyi, et autres
Publié: (2026)
par: Du, Guanyi, et autres
Publié: (2026)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
EmotionGesture: Audio-Driven Diverse Emotional Co-Speech 3D Gesture Generation
par: Qi, Xingqun, et autres
Publié: (2023)
par: Qi, Xingqun, et autres
Publié: (2023)
KSDiff: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial Animation
par: Lyu, Tianle, et autres
Publié: (2025)
par: Lyu, Tianle, et autres
Publié: (2025)
Harmonizing Attention: Training-free Texture-aware Geometry Transfer
par: Ikuta, Eito, et autres
Publié: (2024)
par: Ikuta, Eito, et autres
Publié: (2024)
Programmable-Room: Interactive Textured 3D Room Meshes Generation Empowered by Large Language Models
par: Kim, Jihyun, et autres
Publié: (2025)
par: Kim, Jihyun, et autres
Publié: (2025)
VidCtx: Context-aware Video Question Answering with Image Models
par: Goulas, Andreas, et autres
Publié: (2024)
par: Goulas, Andreas, et autres
Publié: (2024)
URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection
par: Wang, Zhenyu, et autres
Publié: (2026)
par: Wang, Zhenyu, et autres
Publié: (2026)
ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images
par: Li, Xinyue, et autres
Publié: (2026)
par: Li, Xinyue, et autres
Publié: (2026)
GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting
par: Yao, Lei, et autres
Publié: (2025)
par: Yao, Lei, et autres
Publié: (2025)
Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
par: Marinoni, Christian, et autres
Publié: (2025)
par: Marinoni, Christian, et autres
Publié: (2025)
Towards Efficient Low-rate Image Compression with Frequency-aware Diffusion Prior Refinement
par: Xia, Yichong, et autres
Publié: (2026)
par: Xia, Yichong, et autres
Publié: (2026)
SAiD: Speech-driven Blendshape Facial Animation with Diffusion
par: Park, Inkyu, et autres
Publié: (2023)
par: Park, Inkyu, et autres
Publié: (2023)
AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos
par: Hu, Jiagao, et autres
Publié: (2026)
par: Hu, Jiagao, et autres
Publié: (2026)
ReCorD: Reasoning and Correcting Diffusion for HOI Generation
par: Jiang-Lin, Jian-Yu, et autres
Publié: (2024)
par: Jiang-Lin, Jian-Yu, et autres
Publié: (2024)
AdaMesh: Personalized Facial Expressions and Head Poses for Adaptive Speech-Driven 3D Facial Animation
par: Chen, Liyang, et autres
Publié: (2023)
par: Chen, Liyang, et autres
Publié: (2023)
Instant3D: Instant Text-to-3D Generation
par: Li, Ming, et autres
Publié: (2023)
par: Li, Ming, et autres
Publié: (2023)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
par: Ling, Jun, et autres
Publié: (2024)
par: Ling, Jun, et autres
Publié: (2024)
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
par: Arkhipkin, Vladimir, et autres
Publié: (2024)
par: Arkhipkin, Vladimir, et autres
Publié: (2024)
Compressed Deepfake Video Detection Based on 3D Spatiotemporal Trajectories
par: Chen, Zongmei, et autres
Publié: (2024)
par: Chen, Zongmei, et autres
Publié: (2024)
ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
par: Cai, Minghong, et autres
Publié: (2024)
par: Cai, Minghong, et autres
Publié: (2024)
Ges3ViG: Incorporating Pointing Gestures into Language-Based 3D Visual Grounding for Embodied Reference Understanding
par: Mane, Atharv Mahesh, et autres
Publié: (2025)
par: Mane, Atharv Mahesh, et autres
Publié: (2025)
CountingFruit: Language-Guided 3D Fruit Counting with Semantic Gaussian Splatting
par: Li, Fengze, et autres
Publié: (2025)
par: Li, Fengze, et autres
Publié: (2025)
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
par: Zhang, Dongxu, et autres
Publié: (2026)
par: Zhang, Dongxu, et autres
Publié: (2026)
GGAvatar: Reconstructing Garment-Separated 3D Gaussian Splatting Avatars from Monocular Video
par: Chen, Jingxuan
Publié: (2024)
par: Chen, Jingxuan
Publié: (2024)
Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping
par: Zhou, Chao, et autres
Publié: (2026)
par: Zhou, Chao, et autres
Publié: (2026)
Documents similaires
-
FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait
par: Ki, Taekyung, et autres
Publié: (2024) -
StyleLipSync: Style-based Personalized Lip-sync Video Generation
par: Ki, Taekyung, et autres
Publié: (2023) -
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
par: Tan, Weiting, et autres
Publié: (2026) -
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
par: Liu, Kangwei, et autres
Publié: (2025) -
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
par: Qu, Qiang, et autres
Publié: (2025)