SmoothSync: Dual-Stream Diffusion Transformers for Jitter-Robust Beat-Synchronized Gesture Generation from Quantized Audio
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yujiao, Liao, Qingmin, Lu, Zongqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
di: Lei, Ke, et al.
Pubblicazione: (2026)
di: Lei, Ke, et al.
Pubblicazione: (2026)
Post-Training Quantization for Audio Diffusion Transformers
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
Beat-It: Beat-Synchronized Multi-Condition 3D Dance Generation
di: Huang, Zikai, et al.
Pubblicazione: (2024)
di: Huang, Zikai, et al.
Pubblicazione: (2024)
BEAST: Online Joint Beat and Downbeat Tracking Based on Streaming Transformer
di: Chang, Chih-Cheng, et al.
Pubblicazione: (2023)
di: Chang, Chih-Cheng, et al.
Pubblicazione: (2023)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
Audio Array-Based 3D UAV Trajectory Estimation with LiDAR Pseudo-Labeling
di: Lei, Allen, et al.
Pubblicazione: (2024)
di: Lei, Allen, et al.
Pubblicazione: (2024)
Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations
di: Wachter, Maximilian, et al.
Pubblicazione: (2026)
di: Wachter, Maximilian, et al.
Pubblicazione: (2026)
MaskBeat: Loopable Drum Beat Generation
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Complex Image-Generative Diffusion Transformer for Audio Denoising
di: Li, Junhui, et al.
Pubblicazione: (2024)
di: Li, Junhui, et al.
Pubblicazione: (2024)
UniSync: A Unified Framework for Audio-Visual Synchronization
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
An Efficient GPU-based Implementation for Noise Robust Sound Source Localization
di: Lin, Zirui, et al.
Pubblicazione: (2025)
di: Lin, Zirui, et al.
Pubblicazione: (2025)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
Active Listener: Continuous Generation of Listener's Head Motion Response in Dyadic Interactions
di: Ghosh, Bishal, et al.
Pubblicazione: (2024)
di: Ghosh, Bishal, et al.
Pubblicazione: (2024)
Single-Microphone-Based Sound Source Localization for Mobile Robots in Reverberant Environments
di: Wang, Jiang, et al.
Pubblicazione: (2025)
di: Wang, Jiang, et al.
Pubblicazione: (2025)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
di: Gu, Yi, et al.
Pubblicazione: (2026)
di: Gu, Yi, et al.
Pubblicazione: (2026)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
di: Wang, Jin, et al.
Pubblicazione: (2025)
di: Wang, Jin, et al.
Pubblicazione: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Accelerating Audio Research with Robotic Dummy Heads
di: Lu, Austin, et al.
Pubblicazione: (2025)
di: Lu, Austin, et al.
Pubblicazione: (2025)
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
di: Hou, Yuanbo, et al.
Pubblicazione: (2024)
di: Hou, Yuanbo, et al.
Pubblicazione: (2024)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
Theoretical Framework for the Optimization of Microphone Array Configuration for Humanoid Robot Audition
di: Tourbabin, Vladimir, et al.
Pubblicazione: (2024)
di: Tourbabin, Vladimir, et al.
Pubblicazione: (2024)
Disentangled Acoustic Fields For Multimodal Physical Scene Understanding
di: Yin, Jie, et al.
Pubblicazione: (2024)
di: Yin, Jie, et al.
Pubblicazione: (2024)
Long-Term, Store-Front Robotics: Interactive Music for Robotic Arm, Caxixi and Frame Drums
di: Savery, Richard, et al.
Pubblicazione: (2024)
di: Savery, Richard, et al.
Pubblicazione: (2024)
Music to Dance as Language Translation using Sequence Models
di: Correia, André, et al.
Pubblicazione: (2024)
di: Correia, André, et al.
Pubblicazione: (2024)
SonicBoom: Contact Localization Using Array of Microphones
di: Lee, Moonyoung, et al.
Pubblicazione: (2024)
di: Lee, Moonyoung, et al.
Pubblicazione: (2024)
Evaluating Speech-in-Speech Perception via a Humanoid Robot
di: Meyer, Luke, et al.
Pubblicazione: (2023)
di: Meyer, Luke, et al.
Pubblicazione: (2023)
On Adversarial Attacks In Acoustic Drone Localization
di: Shor, Tamir, et al.
Pubblicazione: (2025)
di: Shor, Tamir, et al.
Pubblicazione: (2025)
Human-mimetic binaural ear design and sound source direction estimation for task realization of musculoskeletal humanoids
di: Omura, Yusuke, et al.
Pubblicazione: (2024)
di: Omura, Yusuke, et al.
Pubblicazione: (2024)
AIM: Acoustic Inertial Measurement for Indoor Drone Localization and Tracking
di: Sun, Yimiao, et al.
Pubblicazione: (2025)
di: Sun, Yimiao, et al.
Pubblicazione: (2025)
Direction of Arrival Estimation Using Microphone Array Processing for Moving Humanoid Robots
di: Tourbabin, Vladimir, et al.
Pubblicazione: (2024)
di: Tourbabin, Vladimir, et al.
Pubblicazione: (2024)
Soft Acoustic Curvature Sensor: Design and Development
di: Sofla, Mohammad Sheikh, et al.
Pubblicazione: (2024)
di: Sofla, Mohammad Sheikh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
di: Lei, Ke, et al.
Pubblicazione: (2026) -
Post-Training Quantization for Audio Diffusion Transformers
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025) -
Beat-It: Beat-Synchronized Multi-Condition 3D Dance Generation
di: Huang, Zikai, et al.
Pubblicazione: (2024) -
BEAST: Online Joint Beat and Downbeat Tracking Based on Streaming Transformer
di: Chang, Chih-Cheng, et al.
Pubblicazione: (2023) -
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)