Generation of Musical Timbres using a Text-Guided Diffusion Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Weixuan, Khan, Qadeer, Golkov, Vladimir |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024)
par: Li, Pengcheng, et autres
Publié: (2024)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
par: Yi, Yungang, et autres
Publié: (2024)
par: Yi, Yungang, et autres
Publié: (2024)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
par: Chen, Kuan-Yu, et autres
Publié: (2025)
par: Chen, Kuan-Yu, et autres
Publié: (2025)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
par: Donepudi, Dharma Teja
Publié: (2025)
par: Donepudi, Dharma Teja
Publié: (2025)
Taming Audio VAEs via Target-KL Regularization
par: Seetharaman, Prem, et autres
Publié: (2026)
par: Seetharaman, Prem, et autres
Publié: (2026)
M6(GPT)3: Generating Multitrack Modifiable Multi-Minute MIDI Music from Text using Genetic algorithms, Probabilistic methods and GPT Models in any Progression and Time Signature
par: Poćwiardowski, Jakub, et autres
Publié: (2024)
par: Poćwiardowski, Jakub, et autres
Publié: (2024)
Guitar Tone Morphing by Diffusion-based Model
par: Chen, Kuan-Yu, et autres
Publié: (2025)
par: Chen, Kuan-Yu, et autres
Publié: (2025)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
par: Viswanathan, Janaki, et autres
Publié: (2025)
par: Viswanathan, Janaki, et autres
Publié: (2025)
Window Size Versus Accuracy Experiments in Voice Activity Detectors
par: McKinnon, Max, et autres
Publié: (2026)
par: McKinnon, Max, et autres
Publié: (2026)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
par: Opria, Joshua
Publié: (2026)
par: Opria, Joshua
Publié: (2026)
Bloodroot: When Watermarking Turns Poisonous For Stealthy Backdoor
par: Chen, Kuan-Yu, et autres
Publié: (2025)
par: Chen, Kuan-Yu, et autres
Publié: (2025)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
par: Mehta, Shivam, et autres
Publié: (2024)
par: Mehta, Shivam, et autres
Publié: (2024)
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
An audio-to-analysis pipeline with certified transcription for information-theoretic profiling of the piano repertoire
par: Jalbert-Desforges, Fred
Publié: (2026)
par: Jalbert-Desforges, Fred
Publié: (2026)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
par: Soni, Aniket Abhishek
Publié: (2025)
par: Soni, Aniket Abhishek
Publié: (2025)
MaskClip: Detachable Clip-on Piezoelectric Sensing of Mask Surface Vibrations for Real-time Noise-Robust Speech Input
par: Hiraki, Hirotaka, et autres
Publié: (2025)
par: Hiraki, Hirotaka, et autres
Publié: (2025)
OBHS: An Optimized Block Huffman Scheme for Real-Time Audio Compression
par: Mahfi, Muntahi Safwan, et autres
Publié: (2025)
par: Mahfi, Muntahi Safwan, et autres
Publié: (2025)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
par: Bhadra, Dipayan, et autres
Publié: (2025)
par: Bhadra, Dipayan, et autres
Publié: (2025)
Matcha-TTS: A fast TTS architecture with conditional flow matching
par: Mehta, Shivam, et autres
Publié: (2023)
par: Mehta, Shivam, et autres
Publié: (2023)
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
par: Dhiman, Jai
Publié: (2026)
par: Dhiman, Jai
Publié: (2026)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
par: Chen, Kuan-Yu, et autres
Publié: (2026)
par: Chen, Kuan-Yu, et autres
Publié: (2026)
Quantum-Enhanced Analysis and Grading of Vocal Performance
par: Agarwal, Rohan
Publié: (2025)
par: Agarwal, Rohan
Publié: (2025)
BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps
par: Qian, Lekai, et autres
Publié: (2026)
par: Qian, Lekai, et autres
Publié: (2026)
AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
par: Maben, Leander Melroy, et autres
Publié: (2025)
par: Maben, Leander Melroy, et autres
Publié: (2025)
SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning
par: Chopra, Anuradha, et autres
Publié: (2025)
par: Chopra, Anuradha, et autres
Publié: (2025)
Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
Reciprocal Latent Fields for Precomputed Sound Propagation
par: Seuté, Hugo, et autres
Publié: (2026)
par: Seuté, Hugo, et autres
Publié: (2026)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
par: Aristorenas, Aris J.
Publié: (2024)
par: Aristorenas, Aris J.
Publié: (2024)
GraFPrint: A GNN-Based Approach for Audio Identification
par: Bhattacharjee, Aditya, et autres
Publié: (2024)
par: Bhattacharjee, Aditya, et autres
Publié: (2024)
Adaptable Symbolic Music Infilling with MIDI-RWKV
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
par: Kozak, Nazar
Publié: (2026)
par: Kozak, Nazar
Publié: (2026)
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
par: Cui, Hanfang, et autres
Publié: (2025)
par: Cui, Hanfang, et autres
Publié: (2025)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
par: He, Zhanhong, et autres
Publié: (2025)
par: He, Zhanhong, et autres
Publié: (2025)
Dichotic harmony for the musical practice
par: Madgazin, Vadim R.
Publié: (2010)
par: Madgazin, Vadim R.
Publié: (2010)
Documents similaires
-
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025) -
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025) -
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
par: Yi, Yungang, et autres
Publié: (2024) -
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
par: Chen, Kuan-Yu, et autres
Publié: (2025)