Bidirectional Autoregressive Diffusion Model for Dance Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Canyu, Tang, Youbao, Zhang, Ning, Lin, Ruei-Sung, Han, Mei, Xiao, Jing, Wang, Song |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model
par: Zhang, Bingyuan, et autres
Publié: (2024)
par: Zhang, Bingyuan, et autres
Publié: (2024)
Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance Primitives
par: Li, Ronghui, et autres
Publié: (2024)
par: Li, Ronghui, et autres
Publié: (2024)
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
par: Sun, Changchang, et autres
Publié: (2025)
par: Sun, Changchang, et autres
Publié: (2025)
MotionRAG-Diff: A Retrieval-Augmented Diffusion Framework for Long-Term Music-to-Dance Generation
par: Huang, Mingyang, et autres
Publié: (2025)
par: Huang, Mingyang, et autres
Publié: (2025)
Controllable Dance Generation with Style-Guided Motion Diffusion
par: Wang, Hongsong, et autres
Publié: (2024)
par: Wang, Hongsong, et autres
Publié: (2024)
Exploring Multi-Modal Control in Music-Driven Dance Generation
par: Li, Ronghui, et autres
Publié: (2024)
par: Li, Ronghui, et autres
Publié: (2024)
DanceChat: Large Language Model-Guided Music-to-Dance Generation
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
par: Li, Ronghui, et autres
Publié: (2024)
par: Li, Ronghui, et autres
Publié: (2024)
ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
Inter-Diffusion Generation Model of Speakers and Listeners for Effective Communication
par: Huang, Jinhe, et autres
Publié: (2025)
par: Huang, Jinhe, et autres
Publié: (2025)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
par: Ye, Zhen, et autres
Publié: (2026)
par: Ye, Zhen, et autres
Publié: (2026)
MIDGET: Music Conditioned 3D Dance Generation
par: Wang, Jinwu, et autres
Publié: (2024)
par: Wang, Jinwu, et autres
Publié: (2024)
DuetGen: Music Driven Two-Person Dance Generation via Hierarchical Masked Modeling
par: Ghosh, Anindita, et autres
Publié: (2025)
par: Ghosh, Anindita, et autres
Publié: (2025)
EnchantDance: Unveiling the Potential of Music-Driven Dance Movement
par: Han, Bo, et autres
Publié: (2023)
par: Han, Bo, et autres
Publié: (2023)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
par: Tang, Haobin, et autres
Publié: (2024)
par: Tang, Haobin, et autres
Publié: (2024)
POPDG: Popular 3D Dance Generation with PopDanceSet
par: Luo, Zhenye, et autres
Publié: (2024)
par: Luo, Zhenye, et autres
Publié: (2024)
Duolando: Follower GPT with Off-Policy Reinforcement Learning for Dance Accompaniment
par: Siyao, Li, et autres
Publié: (2024)
par: Siyao, Li, et autres
Publié: (2024)
GCDance: Genre-Controlled Music-Driven 3D Full Body Dance Generation
par: Liu, Xinran, et autres
Publié: (2025)
par: Liu, Xinran, et autres
Publié: (2025)
DIDiffGes: Decoupled Semi-Implicit Diffusion Models for Real-time Gesture Generation from Speech
par: Cheng, Yongkang, et autres
Publié: (2025)
par: Cheng, Yongkang, et autres
Publié: (2025)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
par: Wang, Xuanchen, et autres
Publié: (2024)
par: Wang, Xuanchen, et autres
Publié: (2024)
PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation
par: Im, Jaekwon, et autres
Publié: (2026)
par: Im, Jaekwon, et autres
Publié: (2026)
Dance-to-Music Generation with Encoder-based Textual Inversion
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
par: Liu, Zihao, et autres
Publié: (2025)
par: Liu, Zihao, et autres
Publié: (2025)
Beat-It: Beat-Synchronized Multi-Condition 3D Dance Generation
par: Huang, Zikai, et autres
Publié: (2024)
par: Huang, Zikai, et autres
Publié: (2024)
Dance2MIDI: Dance-driven multi-instruments music generation
par: Han, Bo, et autres
Publié: (2023)
par: Han, Bo, et autres
Publié: (2023)
ESARM: 3D Emotional Speech-to-Animation via Reward Model from Automatically-Ranked Demonstrations
par: Zhang, Xulong, et autres
Publié: (2024)
par: Zhang, Xulong, et autres
Publié: (2024)
Temporally Aligned Audio for Video with Autoregression
par: Viertola, Ilpo, et autres
Publié: (2024)
par: Viertola, Ilpo, et autres
Publié: (2024)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
par: Mao, Yuxin, et autres
Publié: (2023)
par: Mao, Yuxin, et autres
Publié: (2023)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
par: Yu, Chin-Yun, et autres
Publié: (2022)
par: Yu, Chin-Yun, et autres
Publié: (2022)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
SoundLoCD: An Efficient Conditional Discrete Contrastive Latent Diffusion Model for Text-to-Sound Generation
par: Niu, Xinlei, et autres
Publié: (2024)
par: Niu, Xinlei, et autres
Publié: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation
par: Pham, Trung X., et autres
Publié: (2024)
par: Pham, Trung X., et autres
Publié: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
par: Zhuang, Ziyang, et autres
Publié: (2024)
par: Zhuang, Ziyang, et autres
Publié: (2024)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
Documents similaires
-
EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model
par: Zhang, Bingyuan, et autres
Publié: (2024) -
Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance Primitives
par: Li, Ronghui, et autres
Publié: (2024) -
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
par: Sun, Changchang, et autres
Publié: (2025) -
MotionRAG-Diff: A Retrieval-Augmented Diffusion Framework for Long-Term Music-to-Dance Generation
par: Huang, Mingyang, et autres
Publié: (2025) -
Controllable Dance Generation with Style-Guided Motion Diffusion
par: Wang, Hongsong, et autres
Publié: (2024)