Salvato in:
| Autori principali: | Yang, Xiaoda, Zhang, Majun, Pan, Changhao, Huang, Nick, Yuguang, Yang, Zhuo, Fan, Zhou, Pengfei, Zhou, Jin, Shan, Sizhe, Yang, Shan, Yang, Miles, You, Yang, Zhao, Zhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.01809 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
di: Yang, Ziyue, et al.
Pubblicazione: (2026)
di: Yang, Ziyue, et al.
Pubblicazione: (2026)
ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
di: Xu, Jiayang, et al.
Pubblicazione: (2026)
di: Xu, Jiayang, et al.
Pubblicazione: (2026)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
di: Chen, Peikun, et al.
Pubblicazione: (2024)
di: Chen, Peikun, et al.
Pubblicazione: (2024)
SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation
di: Wang, Hongrui, et al.
Pubblicazione: (2026)
di: Wang, Hongrui, et al.
Pubblicazione: (2026)
DanceChat: Large Language Model-Guided Music-to-Dance Generation
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Speech Quality Assessment Model Based on Mixture of Experts: System-Level Performance Enhancement and Utterance-Level Challenge Analysis
di: Hu, Xintong, et al.
Pubblicazione: (2025)
di: Hu, Xintong, et al.
Pubblicazione: (2025)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
di: Yang, Kaixing, et al.
Pubblicazione: (2024)
di: Yang, Kaixing, et al.
Pubblicazione: (2024)
Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty
di: Yang, Zhou, et al.
Pubblicazione: (2026)
di: Yang, Zhou, et al.
Pubblicazione: (2026)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Exploring Multi-Modal Control in Music-Driven Dance Generation
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
di: Dai, Congren, et al.
Pubblicazione: (2025)
di: Dai, Congren, et al.
Pubblicazione: (2025)
EnchantDance: Unveiling the Potential of Music-Driven Dance Movement
di: Han, Bo, et al.
Pubblicazione: (2023)
di: Han, Bo, et al.
Pubblicazione: (2023)
PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
di: Lyu, Guangtao, et al.
Pubblicazione: (2025)
di: Lyu, Guangtao, et al.
Pubblicazione: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Dance-to-Music Generation with Encoder-based Textual Inversion
di: Li, Sifei, et al.
Pubblicazione: (2024)
di: Li, Sifei, et al.
Pubblicazione: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
Acoustic Overspecification in Electronic Dance Music Taxonomy
di: Xu, Weilun, et al.
Pubblicazione: (2025)
di: Xu, Weilun, et al.
Pubblicazione: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval
di: Zhou, Lifeng, et al.
Pubblicazione: (2024)
di: Zhou, Lifeng, et al.
Pubblicazione: (2024)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints
di: Meng, Hao, et al.
Pubblicazione: (2026)
di: Meng, Hao, et al.
Pubblicazione: (2026)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
di: Li, You, et al.
Pubblicazione: (2026)
di: Li, You, et al.
Pubblicazione: (2026)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
ASAudio: A Survey of Advanced Spatial Audio Research
di: Zhu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhu, Zhiyuan, et al.
Pubblicazione: (2025)
GTSinger: A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Music2Fail: Transfer Music to Failed Recorder Style
di: Leong, Chon In, et al.
Pubblicazione: (2024)
di: Leong, Chon In, et al.
Pubblicazione: (2024)
From Speech to Profile: A Protocol-Driven LLM Agent for Psychological Profile Generation
di: Yang, Xingjian, et al.
Pubblicazione: (2026)
di: Yang, Xingjian, et al.
Pubblicazione: (2026)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
di: Chen, Weidong, et al.
Pubblicazione: (2025)
di: Chen, Weidong, et al.
Pubblicazione: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
Detecting Musical Deepfakes
di: Sunday, Nick
Pubblicazione: (2025)
di: Sunday, Nick
Pubblicazione: (2025)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models
di: Li, Jiajia, et al.
Pubblicazione: (2024)
di: Li, Jiajia, et al.
Pubblicazione: (2024)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
di: Ji, Shulei, et al.
Pubblicazione: (2023)
di: Ji, Shulei, et al.
Pubblicazione: (2023)
Documenti analoghi
-
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025) -
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
di: Yang, Ziyue, et al.
Pubblicazione: (2026) -
ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
di: Xu, Jiayang, et al.
Pubblicazione: (2026) -
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
di: Chen, Peikun, et al.
Pubblicazione: (2024) -
SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation
di: Wang, Hongrui, et al.
Pubblicazione: (2026)