Evaluating Latent Space Structure in Timbre VAEs: A Comparative Study of Unsupervised, Descriptor-Conditioned, and Perceptual Feature-Conditioned Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Cameron, Joseph, Blackwell, Alan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Semantic Timbre Dataset for the Electric Guitar
di: Cameron, Joseph, et al.
Pubblicazione: (2026)
di: Cameron, Joseph, et al.
Pubblicazione: (2026)
Pitch-Conditioned Instrument Sound Synthesis From an Interactive Timbre Latent Space
di: Limberg, Christian, et al.
Pubblicazione: (2025)
di: Limberg, Christian, et al.
Pubblicazione: (2025)
A Controllable Perceptual Feature Generative Model for Melody Harmonization via Conditional Variational Autoencoder
di: Huang, Dengyun, et al.
Pubblicazione: (2025)
di: Huang, Dengyun, et al.
Pubblicazione: (2025)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
di: Deng, Qixin, et al.
Pubblicazione: (2025)
di: Deng, Qixin, et al.
Pubblicazione: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
Research on Piano Timbre Transformation System Based on Diffusion Model
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026)
di: Hsu, Chun-Chieh, et al.
Pubblicazione: (2026)
Tutti: Expressive Multi-Singer Synthesis via Structure-Level Timbre Control and Vocal Texture Modeling
di: Chen, Jiatao, et al.
Pubblicazione: (2026)
di: Chen, Jiatao, et al.
Pubblicazione: (2026)
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
di: Han, Jionghao, et al.
Pubblicazione: (2025)
di: Han, Jionghao, et al.
Pubblicazione: (2025)
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
di: Zhang, Bowen, et al.
Pubblicazione: (2026)
di: Zhang, Bowen, et al.
Pubblicazione: (2026)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
The First Voice Timbre Attribute Detection Challenge
di: Chen, Liping, et al.
Pubblicazione: (2025)
di: Chen, Liping, et al.
Pubblicazione: (2025)
The Voice Timbre Attribute Detection 2025 Challenge Evaluation Plan
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
Timbre Difference Capturing in Anomalous Sound Detection
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
State Space Models for Bioacoustics: A Comparative Evaluation with Transformers
di: Tang, Chengyu, et al.
Pubblicazione: (2025)
di: Tang, Chengyu, et al.
Pubblicazione: (2025)
Fast Timing-Conditioned Latent Audio Diffusion
di: Evans, Zach, et al.
Pubblicazione: (2024)
di: Evans, Zach, et al.
Pubblicazione: (2024)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
di: Tian, Haokun, et al.
Pubblicazione: (2025)
di: Tian, Haokun, et al.
Pubblicazione: (2025)
Learning Interpretable Features in Audio Latent Spaces via Sparse Autoencoders
di: Paek, Nathan, et al.
Pubblicazione: (2025)
di: Paek, Nathan, et al.
Pubblicazione: (2025)
Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems
di: Chen, Leduo, et al.
Pubblicazione: (2026)
di: Chen, Leduo, et al.
Pubblicazione: (2026)
Timbre Perception, Representation, and its Neuroscientific Exploration: A Comprehensive Review
di: Zhang, Hong, et al.
Pubblicazione: (2024)
di: Zhang, Hong, et al.
Pubblicazione: (2024)
SoundLoCD: An Efficient Conditional Discrete Contrastive Latent Diffusion Model for Text-to-Sound Generation
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
di: Rouard, Simon, et al.
Pubblicazione: (2024)
di: Rouard, Simon, et al.
Pubblicazione: (2024)
Techniques for Quantum-Computing-Aided Algorithmic Composition: Experiments in Rhythm, Timbre, Harmony, and Space
di: Dobrian, Christopher, et al.
Pubblicazione: (2025)
di: Dobrian, Christopher, et al.
Pubblicazione: (2025)
Perceptual Musical Features for Interpretable Audio Tagging
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023)
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023)
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
di: Jajoria, Pushkar, et al.
Pubblicazione: (2024)
di: Jajoria, Pushkar, et al.
Pubblicazione: (2024)
WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
di: Baoueb, Teysir, et al.
Pubblicazione: (2024)
di: Baoueb, Teysir, et al.
Pubblicazione: (2024)
SAMUeL: Efficient Vocal-Conditioned Music Generation via Soft Alignment Attention and Latent Diffusion
di: Cheung, Hei Shing, et al.
Pubblicazione: (2025)
di: Cheung, Hei Shing, et al.
Pubblicazione: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
di: Wu, Zhiyu, et al.
Pubblicazione: (2025)
di: Wu, Zhiyu, et al.
Pubblicazione: (2025)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Training a Perceptual Model for Evaluating Auditory Similarity in Music Adversarial Attack
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
di: Wang, Siyu, et al.
Pubblicazione: (2025)
di: Wang, Siyu, et al.
Pubblicazione: (2025)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
di: Sun, Changchang, et al.
Pubblicazione: (2025)
di: Sun, Changchang, et al.
Pubblicazione: (2025)
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
di: Li, Haowen, et al.
Pubblicazione: (2026)
di: Li, Haowen, et al.
Pubblicazione: (2026)
Descriptor-Injected Cross-Modal Learning: A Systematic Exploration of Audio-MIDI Alignment via Spectral and Melodic Features
di: Méndez, Mariano Fernández
Pubblicazione: (2026)
di: Méndez, Mariano Fernández
Pubblicazione: (2026)
Documenti analoghi
-
A Semantic Timbre Dataset for the Electric Guitar
di: Cameron, Joseph, et al.
Pubblicazione: (2026) -
Pitch-Conditioned Instrument Sound Synthesis From an Interactive Timbre Latent Space
di: Limberg, Christian, et al.
Pubblicazione: (2025) -
A Controllable Perceptual Feature Generative Model for Melody Harmonization via Conditional Variational Autoencoder
di: Huang, Dengyun, et al.
Pubblicazione: (2025) -
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
di: Mancusi, Michele, et al.
Pubblicazione: (2024) -
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
di: Deng, Qixin, et al.
Pubblicazione: (2025)