SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Xuzheng, Nan, Nan, Wang, Zhilin, Kang, Ziyue, Mo, Zhuoru, Li, Ao, Pan, Yu, Li, Xiaobing, Yu, Feng, Guan, Xiaohong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EMelodyGen: Emotion-Conditioned Melody Generation in ABC Notation with the Musical Feature Template
par: Zhou, Monan, et autres
Publié: (2023)
par: Zhou, Monan, et autres
Publié: (2023)
METEOR: Melody-aware Texture-controllable Symbolic Orchestral Music Generation via Transformer VAE
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024)
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024)
The Spheres Dataset: Multitrack Orchestral Recordings for Music Source Separation and Information Retrieval
par: Garcia-Martinez, Jaime, et autres
Publié: (2025)
par: Garcia-Martinez, Jaime, et autres
Publié: (2025)
MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music Processing
par: Wu, Shangda, et autres
Publié: (2024)
par: Wu, Shangda, et autres
Publié: (2024)
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
par: Wang, Yashan, et autres
Publié: (2025)
par: Wang, Yashan, et autres
Publié: (2025)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Learning to Attend to Depression-Related Patterns: An Adaptive Cross-Modal Gating Network for Depression Detection
par: Yu, Hangbin, et autres
Publié: (2026)
par: Yu, Hangbin, et autres
Publié: (2026)
TISDiSS: A Training-Time and Inference-Time Scalable Framework for Discriminative Source Separation
par: Feng, Yongsheng, et autres
Publié: (2025)
par: Feng, Yongsheng, et autres
Publié: (2025)
Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS
par: Susladkar, Onkar Kishor, et autres
Publié: (2024)
par: Susladkar, Onkar Kishor, et autres
Publié: (2024)
Harmony and Duality: An introduction to Music Theory
par: Lipyanskiy, Maksim
Publié: (2023)
par: Lipyanskiy, Maksim
Publié: (2023)
Gen-SER: When the generative model meets speech emotion recognition
par: Wang, Taihui, et autres
Publié: (2026)
par: Wang, Taihui, et autres
Publié: (2026)
TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis
par: Liang, Qifan, et autres
Publié: (2026)
par: Liang, Qifan, et autres
Publié: (2026)
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
par: Guo, Wenxiang, et autres
Publié: (2025)
par: Guo, Wenxiang, et autres
Publié: (2025)
TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography
par: Dai, Yuqin, et autres
Publié: (2025)
par: Dai, Yuqin, et autres
Publié: (2025)
An Agent-Based Framework for Automated Higher-Voice Harmony Generation
par: Ganapathy, Nia D'Souza, et autres
Publié: (2025)
par: Ganapathy, Nia D'Souza, et autres
Publié: (2025)
From Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR
par: Xu, Nan, et autres
Publié: (2026)
par: Xu, Nan, et autres
Publié: (2026)
Hierarchical Control of Emotion Rendering in Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Versatile Framework for Song Generation with Prompt-based Control
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
par: Li, Haoxun, et autres
Publié: (2025)
par: Li, Haoxun, et autres
Publié: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
par: Wang, Kaidi, et autres
Publié: (2025)
par: Wang, Kaidi, et autres
Publié: (2025)
Periodicity Pitch Detection in Complex Harmonies on EEG Timeline Data
par: Heinze, Maria, et autres
Publié: (2020)
par: Heinze, Maria, et autres
Publié: (2020)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Hierarchical Pooling Structure for Weakly Labeled Sound Event Detection
par: He, Ke-Xin, et autres
Publié: (2019)
par: He, Ke-Xin, et autres
Publié: (2019)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers
par: Fu, Linya, et autres
Publié: (2025)
par: Fu, Linya, et autres
Publié: (2025)
ELGAR: Expressive Cello Performance Motion Generation for Audio Rendition
par: Qiu, Zhiping, et autres
Publié: (2025)
par: Qiu, Zhiping, et autres
Publié: (2025)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
LARA-Gen: Enabling Continuous Emotion Control for Music Generation Models via Latent Affective Representation Alignment
par: Mei, Jiahao, et autres
Publié: (2025)
par: Mei, Jiahao, et autres
Publié: (2025)
PiCoGen: Generate Piano Covers with a Two-stage Approach
par: Tan, Chih-Pin, et autres
Publié: (2024)
par: Tan, Chih-Pin, et autres
Publié: (2024)
TEAdapter: Supply abundant guidance for controllable text-to-music generation
par: Zou, Jialing, et autres
Publié: (2024)
par: Zou, Jialing, et autres
Publié: (2024)
Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
par: Liu, Jiafeng, et autres
Publié: (2026)
par: Liu, Jiafeng, et autres
Publié: (2026)
Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances
par: Ding, Ziqi, et autres
Publié: (2026)
par: Ding, Ziqi, et autres
Publié: (2026)
Infant Cry Detection In Noisy Environment Using Blueprint Separable Convolutions and Time-Frequency Recurrent Neural Network
par: Yu, Haolin, et autres
Publié: (2025)
par: Yu, Haolin, et autres
Publié: (2025)
KS-Net: Multi-band joint speech restoration and enhancement network for 2024 ICASSP SSI Challenge
par: Yu, Guochen, et autres
Publié: (2024)
par: Yu, Guochen, et autres
Publié: (2024)
Two-sided Acoustic Metascreen for Broadband and Individual Reflection and Transmission Control
par: Chen, Ao, et autres
Publié: (2024)
par: Chen, Ao, et autres
Publié: (2024)
CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
par: Wu, Shangda, et autres
Publié: (2025)
par: Wu, Shangda, et autres
Publié: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
par: Mei, Jiahao, et autres
Publié: (2026)
par: Mei, Jiahao, et autres
Publié: (2026)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2025)
par: Inoue, Sho, et autres
Publié: (2025)
An Efficient Transfer Learning Method Based on Adapter with Local Attributes for Speech Emotion Recognition
par: Song, Haoyu, et autres
Publié: (2025)
par: Song, Haoyu, et autres
Publié: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Documents similaires
-
EMelodyGen: Emotion-Conditioned Melody Generation in ABC Notation with the Musical Feature Template
par: Zhou, Monan, et autres
Publié: (2023) -
METEOR: Melody-aware Texture-controllable Symbolic Orchestral Music Generation via Transformer VAE
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024) -
The Spheres Dataset: Multitrack Orchestral Recordings for Music Source Separation and Information Retrieval
par: Garcia-Martinez, Jaime, et autres
Publié: (2025) -
MelodyT5: A Unified Score-to-Score Transformer for Symbolic Music Processing
par: Wu, Shangda, et autres
Publié: (2024) -
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
par: Wang, Yashan, et autres
Publié: (2025)