Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Haokun, Lattner, Stefan, Saitis, Charalampos |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hybrid Losses for Hierarchical Embedding Learning
par: Tian, Haokun, et autres
Publié: (2025)
par: Tian, Haokun, et autres
Publié: (2025)
Real-time Timbre Remapping with Differentiable DSP
par: Shier, Jordie, et autres
Publié: (2024)
par: Shier, Jordie, et autres
Publié: (2024)
Audio synthesizer inversion in symmetric parameter spaces with approximately equivariant flow matching
par: Hayes, Ben, et autres
Publié: (2025)
par: Hayes, Ben, et autres
Publié: (2025)
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
par: Lee, Ching Ho, et autres
Publié: (2026)
par: Lee, Ching Ho, et autres
Publié: (2026)
Mamba-Diffusion Model with Learnable Wavelet for Controllable Symbolic Music Generation
par: Zhang, Jincheng, et autres
Publié: (2025)
par: Zhang, Jincheng, et autres
Publié: (2025)
Composer Style-specific Symbolic Music Generation Using Vector Quantized Discrete Diffusion Models
par: Zhang, Jincheng, et autres
Publié: (2023)
par: Zhang, Jincheng, et autres
Publié: (2023)
Music2Latent: Consistency Autoencoders for Latent Audio Compression
par: Pasini, Marco, et autres
Publié: (2024)
par: Pasini, Marco, et autres
Publié: (2024)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
par: Pasini, Marco, et autres
Publié: (2025)
par: Pasini, Marco, et autres
Publié: (2025)
Improving Musical Accompaniment Co-creation via Diffusion Transformers
par: Nistal, Javier, et autres
Publié: (2024)
par: Nistal, Javier, et autres
Publié: (2024)
Estimating Musical Surprisal from Audio in Autoregressive Diffusion Model Noise Spaces
par: Bjare, Mathias Rose, et autres
Publié: (2025)
par: Bjare, Mathias Rose, et autres
Publié: (2025)
Singer Identity Representation Learning using Self-Supervised Techniques
par: Torres, Bernardo, et autres
Publié: (2024)
par: Torres, Bernardo, et autres
Publié: (2024)
Estimating Musical Surprisal in Audio
par: Bjare, Mathias Rose, et autres
Publié: (2025)
par: Bjare, Mathias Rose, et autres
Publié: (2025)
Timbre Perception, Representation, and its Neuroscientific Exploration: A Comprehensive Review
par: Zhang, Hong, et autres
Publié: (2024)
par: Zhang, Hong, et autres
Publié: (2024)
PESTO: Pitch Estimation with Self-supervised Transposition-equivariant Objective
par: Riou, Alain, et autres
Publié: (2023)
par: Riou, Alain, et autres
Publié: (2023)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
par: Riou, Alain, et autres
Publié: (2024)
par: Riou, Alain, et autres
Publié: (2024)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
Timbre Difference Capturing in Anomalous Sound Detection
par: Nishida, Tomoya, et autres
Publié: (2024)
par: Nishida, Tomoya, et autres
Publié: (2024)
Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
par: Pasini, Marco, et autres
Publié: (2025)
par: Pasini, Marco, et autres
Publié: (2025)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
par: Deng, Qixin, et autres
Publié: (2025)
par: Deng, Qixin, et autres
Publié: (2025)
Bass Accompaniment Generation via Latent Diffusion
par: Pasini, Marco, et autres
Publié: (2024)
par: Pasini, Marco, et autres
Publié: (2024)
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
par: Xin, Yifei, et autres
Publié: (2024)
par: Xin, Yifei, et autres
Publié: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences
par: Kishi, Minoru, et autres
Publié: (2025)
par: Kishi, Minoru, et autres
Publié: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
par: Wu, Zhiyu, et autres
Publié: (2025)
par: Wu, Zhiyu, et autres
Publié: (2025)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
par: Kim, Tae-Woo, et autres
Publié: (2022)
par: Kim, Tae-Woo, et autres
Publié: (2022)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
par: Li, Haowen, et autres
Publié: (2026)
par: Li, Haowen, et autres
Publié: (2026)
WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
par: Baoueb, Teysir, et autres
Publié: (2024)
par: Baoueb, Teysir, et autres
Publié: (2024)
Compositional Audio Representation Learning
par: Sridhar, Sripathi, et autres
Publié: (2024)
par: Sridhar, Sripathi, et autres
Publié: (2024)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
par: Mancusi, Michele, et autres
Publié: (2024)
par: Mancusi, Michele, et autres
Publié: (2024)
BINAQUAL: A Full-Reference Objective Localization Similarity Metric for Binaural Audio
par: Panah, Davoud Shariat, et autres
Publié: (2025)
par: Panah, Davoud Shariat, et autres
Publié: (2025)
Audio Fingerprinting with Holographic Reduced Representations
par: Fujita, Yusuke, et autres
Publié: (2024)
par: Fujita, Yusuke, et autres
Publié: (2024)
Interpolation Filter Design for Sample Rate Independent Audio Effect RNNs
par: Carson, Alistair, et autres
Publié: (2024)
par: Carson, Alistair, et autres
Publié: (2024)
Learning Separated Representations for Instrument-based Music Similarity
par: Hashizume, Yuka, et autres
Publié: (2025)
par: Hashizume, Yuka, et autres
Publié: (2025)
Designing Neural Synthesizers for Low-Latency Interaction
par: Caspe, Franco, et autres
Publié: (2025)
par: Caspe, Franco, et autres
Publié: (2025)
Speech Representation Analysis based on Inter- and Intra-Model Similarities
par: Kheir, Yassine El, et autres
Publié: (2024)
par: Kheir, Yassine El, et autres
Publié: (2024)
Sample Rate Independent Recurrent Neural Networks for Audio Effects Processing
par: Carson, Alistair, et autres
Publié: (2024)
par: Carson, Alistair, et autres
Publié: (2024)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Documents similaires
-
Hybrid Losses for Hierarchical Embedding Learning
par: Tian, Haokun, et autres
Publié: (2025) -
Real-time Timbre Remapping with Differentiable DSP
par: Shier, Jordie, et autres
Publié: (2024) -
Audio synthesizer inversion in symmetric parameter spaces with approximately equivariant flow matching
par: Hayes, Ben, et autres
Publié: (2025) -
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
par: Lee, Ching Ho, et autres
Publié: (2026) -
Mamba-Diffusion Model with Learnable Wavelet for Controllable Symbolic Music Generation
par: Zhang, Jincheng, et autres
Publié: (2025)