Investigation of perceptual music similarity focusing on each instrumental part
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hashizume, Yuka, Toda, Tomoki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Separated Representations for Instrument-based Music Similarity
par: Hashizume, Yuka, et autres
Publié: (2025)
par: Hashizume, Yuka, et autres
Publié: (2025)
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
par: Hashizume, Yuka, et autres
Publié: (2024)
par: Hashizume, Yuka, et autres
Publié: (2024)
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
par: Imamura, Takehiro, et autres
Publié: (2025)
par: Imamura, Takehiro, et autres
Publié: (2025)
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
par: Halpern, Bence Mark, et autres
Publié: (2025)
par: Halpern, Bence Mark, et autres
Publié: (2025)
Serial-OE: Anomalous sound detection based on serial method with outlier exposure capable of using small amounts of anomalous data for training
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
par: Mi, Jinyi, et autres
Publié: (2024)
par: Mi, Jinyi, et autres
Publié: (2024)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
par: Fujimura, Takuya, et autres
Publié: (2024)
par: Fujimura, Takuya, et autres
Publié: (2024)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
par: Chen, Shaowen, et autres
Publié: (2025)
par: Chen, Shaowen, et autres
Publié: (2025)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
par: Violeta, Lester Phillip, et autres
Publié: (2025)
par: Violeta, Lester Phillip, et autres
Publié: (2025)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
par: Yoneyama, Reo, et autres
Publié: (2024)
par: Yoneyama, Reo, et autres
Publié: (2024)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)
par: Hu, Cheng-Hung, et autres
Publié: (2025)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
par: Cooper, Erica, et autres
Publié: (2025)
par: Cooper, Erica, et autres
Publié: (2025)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
par: Yoneyama, Reo, et autres
Publié: (2025)
par: Yoneyama, Reo, et autres
Publié: (2025)
Handling Domain Shifts for Anomalous Sound Detection: A Review of DCASE-Related Work
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
Electrolaryngeal Speech Intelligibility Enhancement Through Robust Linguistic Encoders
par: Violeta, Lester Phillip, et autres
Publié: (2023)
par: Violeta, Lester Phillip, et autres
Publié: (2023)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
par: Violeta, Lester Phillip, et autres
Publié: (2025)
par: Violeta, Lester Phillip, et autres
Publié: (2025)
Dance2MIDI: Dance-driven multi-instruments music generation
par: Han, Bo, et autres
Publié: (2023)
par: Han, Bo, et autres
Publié: (2023)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
par: Shi, Xiaohan, et autres
Publié: (2023)
par: Shi, Xiaohan, et autres
Publié: (2023)
Multi-speaker Text-to-speech Training with Speaker Anonymized Data
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
VAE-based Phoneme Alignment Using Gradient Annealing and SSL Acoustic Features
par: Koriyama, Tomoki
Publié: (2024)
par: Koriyama, Tomoki
Publié: (2024)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
Computationally-efficient and perceptually-motivated rendering of diffuse reflections in room acoustics simulation
par: Ewert, Stephan D., et autres
Publié: (2023)
par: Ewert, Stephan D., et autres
Publié: (2023)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
Enhancing spatial hearing with cochlear implants: exploring the role of AI, multimodal interaction and perceptual training
par: Picinali, Lorenzo, et autres
Publié: (2026)
par: Picinali, Lorenzo, et autres
Publié: (2026)
The AudioMOS Challenge 2025
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024)
par: He, Jiajun, et autres
Publié: (2024)
From the perspective of perceptual speech quality: The robustness of frequency bands to noise
par: Fan, Junyi, et autres
Publié: (2025)
par: Fan, Junyi, et autres
Publié: (2025)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
par: Mi, Jinyi, et autres
Publié: (2024)
par: Mi, Jinyi, et autres
Publié: (2024)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
An Attribute Interpolation Method in Speech Synthesis by Model Merging
par: Murata, Masato, et autres
Publié: (2024)
par: Murata, Masato, et autres
Publié: (2024)
Frame-Wise Breath Detection with Self-Training: An Exploration of Enhancing Breath Naturalness in Text-to-Speech
par: Yang, Dong, et autres
Publié: (2024)
par: Yang, Dong, et autres
Publié: (2024)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
par: Honda, Tomoki, et autres
Publié: (2024)
par: Honda, Tomoki, et autres
Publié: (2024)
On the influence of language similarity in non-target speaker verification trials
par: Reuter, Paul M., et autres
Publié: (2025)
par: Reuter, Paul M., et autres
Publié: (2025)
Documents similaires
-
Learning Separated Representations for Instrument-based Music Similarity
par: Hashizume, Yuka, et autres
Publié: (2025) -
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
par: Hashizume, Yuka, et autres
Publié: (2024) -
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
par: Imamura, Takehiro, et autres
Publié: (2025) -
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
par: Halpern, Bence Mark, et autres
Publié: (2025) -
Serial-OE: Anomalous sound detection based on serial method with outlier exposure capable of using small amounts of anomalous data for training
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)