SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision
Fuente:
arXiv
Salvato in:
| Autori principali: | Hao, Chunbo, Yuan, Ruibin, Yao, Jixun, Deng, Qixin, Bai, Xinyi, Wang, Yanbo, Xue, Wei, Xie, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SongEval: A Benchmark Dataset for Song Aesthetics Evaluation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion
di: Ning, Ziqian, et al.
Pubblicazione: (2025)
di: Ning, Ziqian, et al.
Pubblicazione: (2025)
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
di: Chen, Huakang, et al.
Pubblicazione: (2025)
di: Chen, Huakang, et al.
Pubblicazione: (2025)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
di: Ma, Guobin, et al.
Pubblicazione: (2026)
di: Ma, Guobin, et al.
Pubblicazione: (2026)
DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation
di: Chen, Huakang, et al.
Pubblicazione: (2026)
di: Chen, Huakang, et al.
Pubblicazione: (2026)
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
di: Guo, Dake, et al.
Pubblicazione: (2025)
di: Guo, Dake, et al.
Pubblicazione: (2025)
SongTrans: An unified song transcription and alignment method for lyrics and notes
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
MUSA: Multi-lingual Speaker Anonymization via Serial Disentanglement
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
YingMusic-Singer-Plus: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance
di: Hao, Chunbo, et al.
Pubblicazione: (2026)
di: Hao, Chunbo, et al.
Pubblicazione: (2026)
Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction
di: Du, Renmingyue, et al.
Pubblicazione: (2024)
di: Du, Renmingyue, et al.
Pubblicazione: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
FruitsMusic: A Real-World Corpus of Japanese Idol-Group Songs
di: Suda, Hitoshi, et al.
Pubblicazione: (2024)
di: Suda, Hitoshi, et al.
Pubblicazione: (2024)
Voices of Civilizations: A Multilingual QA Benchmark for Global Music Understanding
di: Wu, Shangda, et al.
Pubblicazione: (2026)
di: Wu, Shangda, et al.
Pubblicazione: (2026)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
TOMI: Transforming and Organizing Music Ideas for Multi-Track Compositions with Full-Song Structure
di: He, Qi, et al.
Pubblicazione: (2025)
di: He, Qi, et al.
Pubblicazione: (2025)
Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment
di: Hong, Zhiqing, et al.
Pubblicazione: (2024)
di: Hong, Zhiqing, et al.
Pubblicazione: (2024)
Semi-Supervised Contrastive Learning of Musical Representations
di: Guinot, Julien, et al.
Pubblicazione: (2024)
di: Guinot, Julien, et al.
Pubblicazione: (2024)
NPU-NTU System for Voice Privacy 2024 Challenge
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
KALL-E:Autoregressive Speech Synthesis with Next-Distribution Prediction
di: Xia, Kangxiang, et al.
Pubblicazione: (2024)
di: Xia, Kangxiang, et al.
Pubblicazione: (2024)
Automatic Live Music Song Identification Using Multi-level Deep Sequence Similarity Learning
di: Hakala, Aapo, et al.
Pubblicazione: (2025)
di: Hakala, Aapo, et al.
Pubblicazione: (2025)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
NTU-NPU System for Voice Privacy 2024 Challenge
di: Kuzmin, Nikita, et al.
Pubblicazione: (2024)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2024)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
di: Wu, Shangda, et al.
Pubblicazione: (2025)
di: Wu, Shangda, et al.
Pubblicazione: (2025)
Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation
di: Zhang, Huaicheng, et al.
Pubblicazione: (2025)
di: Zhang, Huaicheng, et al.
Pubblicazione: (2025)
SongCreator: Lyrics-based Universal Song Generation
di: Lei, Shun, et al.
Pubblicazione: (2024)
di: Lei, Shun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SongEval: A Benchmark Dataset for Song Aesthetics Evaluation
di: Yao, Jixun, et al.
Pubblicazione: (2025) -
DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion
di: Ning, Ziqian, et al.
Pubblicazione: (2025) -
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
di: Chen, Huakang, et al.
Pubblicazione: (2025) -
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
di: Ma, Guobin, et al.
Pubblicazione: (2026) -
DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)