ST-GDance++: A Scalable Spatial-Temporal Diffusion for Long-Duration Group Choreography
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Jing, Wang, Weiqiang, Chen, Cunjian, Liu, Jun, Ke, Qiuhong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ST-GDance: Long-Term and Collision-Free Group Choreography from Music
par: Xu, Jing, et autres
Publié: (2025)
par: Xu, Jing, et autres
Publié: (2025)
EAvatar: Expression-Aware Head Avatar Reconstruction with Generative Geometry Priors
par: Zhang, Shikun, et autres
Publié: (2025)
par: Zhang, Shikun, et autres
Publié: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions
par: Yu, Jiashuo, et autres
Publié: (2026)
par: Yu, Jiashuo, et autres
Publié: (2026)
DiffusionTalker: Efficient and Compact Speech-Driven 3D Talking Head via Personalizer-Guided Distillation
par: Chen, Peng, et autres
Publié: (2025)
par: Chen, Peng, et autres
Publié: (2025)
TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography
par: Dai, Yuqin, et autres
Publié: (2025)
par: Dai, Yuqin, et autres
Publié: (2025)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments
par: Liu, Zhan, et autres
Publié: (2026)
par: Liu, Zhan, et autres
Publié: (2026)
TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation
par: Mazumdar, Soumya, et autres
Publié: (2026)
par: Mazumdar, Soumya, et autres
Publié: (2026)
Latent Swap Joint Diffusion for 2D Long-Form Latent Generation
par: Dai, Yusheng, et autres
Publié: (2025)
par: Dai, Yusheng, et autres
Publié: (2025)
Diffusion Models for Joint Audio-Video Generation
par: La Torre, Alejandro Paredes
Publié: (2026)
par: La Torre, Alejandro Paredes
Publié: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
par: Weng, Yuzhe, et autres
Publié: (2026)
par: Weng, Yuzhe, et autres
Publié: (2026)
Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion Model
par: Park, Sangjune, et autres
Publié: (2026)
par: Park, Sangjune, et autres
Publié: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
par: Cui, Zijun, et autres
Publié: (2026)
par: Cui, Zijun, et autres
Publié: (2026)
VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin
par: Ai, Zhiqi, et autres
Publié: (2025)
par: Ai, Zhiqi, et autres
Publié: (2025)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
Lodge++: High-quality and Long Dance Generation with Vivid Choreography Patterns
par: Li, Ronghui, et autres
Publié: (2024)
par: Li, Ronghui, et autres
Publié: (2024)
TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
par: Ton, Tri, et autres
Publié: (2025)
par: Ton, Tri, et autres
Publié: (2025)
Graph Propagated Projection Unlearning: A Unified Framework for Vision and Audio Discriminative Models
par: Pathak, Shreyansh, et autres
Publié: (2026)
par: Pathak, Shreyansh, et autres
Publié: (2026)
TRACE: Training-Free Partial Audio Deepfake Detection via Embedding Trajectory Analysis of Speech Foundation Models
par: Khan, Awais, et autres
Publié: (2026)
par: Khan, Awais, et autres
Publié: (2026)
Materialistic RIR: Material Conditioned Realistic RIR Generation
par: Saad, Mahnoor Fatima, et autres
Publié: (2026)
par: Saad, Mahnoor Fatima, et autres
Publié: (2026)
Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping
par: Khanal, Subash, et autres
Publié: (2025)
par: Khanal, Subash, et autres
Publié: (2025)
Real-Time Object Tracking with On-Device Deep Learning for Adaptive Beamforming in Dynamic Acoustic Environments
par: Ortigoso-Narro, Jorge, et autres
Publié: (2025)
par: Ortigoso-Narro, Jorge, et autres
Publié: (2025)
DeepAgent: A Dual Stream Multi Agent Fusion for Robust Multimodal Deepfake Detection
par: Zaman, Sayeem Been, et autres
Publié: (2025)
par: Zaman, Sayeem Been, et autres
Publié: (2025)
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
par: Yang, Ziyue, et autres
Publié: (2026)
par: Yang, Ziyue, et autres
Publié: (2026)
IMSE: Efficient U-Net-based Speech Enhancement using Inception Depthwise Convolution and Amplitude-Aware Linear Attention
par: Tang, Xinxin, et autres
Publié: (2025)
par: Tang, Xinxin, et autres
Publié: (2025)
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)
par: Wang, Chengyao, et autres
Publié: (2025)
Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation
par: Nie, Chang, et autres
Publié: (2026)
par: Nie, Chang, et autres
Publié: (2026)
LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
par: Tan, Weiting, et autres
Publié: (2026)
par: Tan, Weiting, et autres
Publié: (2026)
DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap
par: Mo, Shentong, et autres
Publié: (2025)
par: Mo, Shentong, et autres
Publié: (2025)
DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation
par: Chen, Junming, et autres
Publié: (2024)
par: Chen, Junming, et autres
Publié: (2024)
SoundVista: Novel-View Ambient Sound Synthesis via Visual-Acoustic Binding
par: Chen, Mingfei, et autres
Publié: (2025)
par: Chen, Mingfei, et autres
Publié: (2025)
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
par: Pham, Kien T., et autres
Publié: (2025)
par: Pham, Kien T., et autres
Publié: (2025)
A Lightweight Group Multiscale Bidirectional Interactive Network for Real-Time Steel Surface Defect Detection
par: Zhang, Yong, et autres
Publié: (2025)
par: Zhang, Yong, et autres
Publié: (2025)
See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
par: Wang, Jinting, et autres
Publié: (2025)
par: Wang, Jinting, et autres
Publié: (2025)
Skeleton-OOD: An End-to-End Skeleton-Based Model for Robust Out-of-Distribution Human Action Detection
par: Xu, Jing, et autres
Publié: (2024)
par: Xu, Jing, et autres
Publié: (2024)
Documents similaires
-
ST-GDance: Long-Term and Collision-Free Group Choreography from Music
par: Xu, Jing, et autres
Publié: (2025) -
EAvatar: Expression-Aware Head Avatar Reconstruction with Generative Geometry Priors
par: Zhang, Shikun, et autres
Publié: (2025) -
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025) -
JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions
par: Yu, Jiashuo, et autres
Publié: (2026) -
DiffusionTalker: Efficient and Compact Speech-Driven 3D Talking Head via Personalizer-Guided Distillation
par: Chen, Peng, et autres
Publié: (2025)