Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
Fuente:
arXiv
Guardado en:
| Autores principales: | Imamura, Takehiro, Hashizume, Yuka, Huang, Wen-Chin, Toda, Tomoki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Separated Representations for Instrument-based Music Similarity
por: Hashizume, Yuka, et al.
Publicado: (2025)
por: Hashizume, Yuka, et al.
Publicado: (2025)
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
por: Hashizume, Yuka, et al.
Publicado: (2024)
por: Hashizume, Yuka, et al.
Publicado: (2024)
Investigation of perceptual music similarity focusing on each instrumental part
por: Hashizume, Yuka, et al.
Publicado: (2025)
por: Hashizume, Yuka, et al.
Publicado: (2025)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
por: Huang, Wen-Chin, et al.
Publicado: (2025)
por: Huang, Wen-Chin, et al.
Publicado: (2025)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
por: Huang, Wen-Chin, et al.
Publicado: (2024)
por: Huang, Wen-Chin, et al.
Publicado: (2024)
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
ACMID: Automatic Curation of Musical Instrument Dataset for 7-Stem Music Source Separation
por: Yu, Ji, et al.
Publicado: (2025)
por: Yu, Ji, et al.
Publicado: (2025)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
por: Mi, Jinyi, et al.
Publicado: (2024)
por: Mi, Jinyi, et al.
Publicado: (2024)
Multi-speaker Text-to-speech Training with Speaker Anonymized Data
por: Huang, Wen-Chin, et al.
Publicado: (2024)
por: Huang, Wen-Chin, et al.
Publicado: (2024)
Electrolaryngeal Speech Intelligibility Enhancement Through Robust Linguistic Encoders
por: Violeta, Lester Phillip, et al.
Publicado: (2023)
por: Violeta, Lester Phillip, et al.
Publicado: (2023)
Serial-OE: Anomalous sound detection based on serial method with outlier exposure capable of using small amounts of anomalous data for training
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
por: Murata, Masato, et al.
Publicado: (2025)
por: Murata, Masato, et al.
Publicado: (2025)
Embedding-Based Intrusive Evaluation Metrics for Musical Source Separation Using MERT Representations
por: Bereuter, Paul A., et al.
Publicado: (2026)
por: Bereuter, Paul A., et al.
Publicado: (2026)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
por: Fujimura, Takuya, et al.
Publicado: (2024)
por: Fujimura, Takuya, et al.
Publicado: (2024)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
por: Chen, Shaowen, et al.
Publicado: (2025)
por: Chen, Shaowen, et al.
Publicado: (2025)
Improving Music Source Separation with Diffusion and Consistency Refinement
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
Exploiting Music Source Separation for Automatic Lyrics Transcription with Whisper
por: Syed, Jaza, et al.
Publicado: (2025)
por: Syed, Jaza, et al.
Publicado: (2025)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
por: Hu, Cheng-Hung, et al.
Publicado: (2025)
por: Hu, Cheng-Hung, et al.
Publicado: (2025)
Musical Source Separation of Brazilian Percussion
por: Namballa, Richa, et al.
Publicado: (2025)
por: Namballa, Richa, et al.
Publicado: (2025)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
por: Huang, Wen-Chin, et al.
Publicado: (2024)
por: Huang, Wen-Chin, et al.
Publicado: (2024)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
por: Yoneyama, Reo, et al.
Publicado: (2024)
por: Yoneyama, Reo, et al.
Publicado: (2024)
The AudioMOS Challenge 2025
por: Huang, Wen-Chin, et al.
Publicado: (2025)
por: Huang, Wen-Chin, et al.
Publicado: (2025)
Moises-Light: Resource-efficient Band-split U-Net For Music Source Separation
por: Yun-Ning, et al.
Publicado: (2025)
por: Yun-Ning, et al.
Publicado: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
por: Shi, Xiaohan, et al.
Publicado: (2023)
por: Shi, Xiaohan, et al.
Publicado: (2023)
Music Source Separation Based on a Lightweight Deep Learning Framework (DTTNET: DUAL-PATH TFC-TDF UNET)
por: Chen, Junyu, et al.
Publicado: (2023)
por: Chen, Junyu, et al.
Publicado: (2023)
Lead Instrument Detection from Multitrack Music
por: Ou, Longshen, et al.
Publicado: (2025)
por: Ou, Longshen, et al.
Publicado: (2025)
The Whole Is Greater than the Sum of Its Parts: Improving Music Source Separation by Bridging Network
por: Sawata, Ryosuke, et al.
Publicado: (2023)
por: Sawata, Ryosuke, et al.
Publicado: (2023)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
por: Cooper, Erica, et al.
Publicado: (2025)
por: Cooper, Erica, et al.
Publicado: (2025)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
por: Yoneyama, Reo, et al.
Publicado: (2025)
por: Yoneyama, Reo, et al.
Publicado: (2025)
Advancing Speech Quality Assessment Through Scientific Challenges and Open-source Activities
por: Huang, Wen-Chin
Publicado: (2025)
por: Huang, Wen-Chin
Publicado: (2025)
Source Separation & Automatic Transcription for Music
por: Derby, Bradford, et al.
Publicado: (2024)
por: Derby, Bradford, et al.
Publicado: (2024)
Aligning Text-to-Music Evaluation with Human Preferences
por: Huang, Yichen, et al.
Publicado: (2025)
por: Huang, Yichen, et al.
Publicado: (2025)
MusicRL: Aligning Music Generation to Human Preferences
por: Cideron, Geoffrey, et al.
Publicado: (2024)
por: Cideron, Geoffrey, et al.
Publicado: (2024)
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
por: Namballa, Richa, et al.
Publicado: (2025)
por: Namballa, Richa, et al.
Publicado: (2025)
A Neural Score Follower for Computer Accompaniment of Polyphonic Musical Instruments
por: Pillay, Ashwin
Publicado: (2025)
por: Pillay, Ashwin
Publicado: (2025)
Automatic Live Music Song Identification Using Multi-level Deep Sequence Similarity Learning
por: Hakala, Aapo, et al.
Publicado: (2025)
por: Hakala, Aapo, et al.
Publicado: (2025)
Source Separation by Flow Matching
por: Scheibler, Robin, et al.
Publicado: (2025)
por: Scheibler, Robin, et al.
Publicado: (2025)
Ejemplares similares
-
Learning Separated Representations for Instrument-based Music Similarity
por: Hashizume, Yuka, et al.
Publicado: (2025) -
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
por: Hashizume, Yuka, et al.
Publicado: (2024) -
Investigation of perceptual music similarity focusing on each instrumental part
por: Hashizume, Yuka, et al.
Publicado: (2025) -
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
por: Huang, Wen-Chin, et al.
Publicado: (2025) -
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
por: Huang, Wen-Chin, et al.
Publicado: (2024)