WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Baoueb, Teysir, Bie, Xiaoyu, Janati, Hicham, Richard, Gael |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
di: Baoueb, Teysir, et al.
Pubblicazione: (2025)
di: Baoueb, Teysir, et al.
Pubblicazione: (2025)
Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models
di: Baoueb, Teysir, et al.
Pubblicazione: (2025)
di: Baoueb, Teysir, et al.
Pubblicazione: (2025)
GLA-Grad: A Griffin-Lim Extended Waveform Generation Diffusion Model
di: Liu, Haocheng, et al.
Pubblicazione: (2024)
di: Liu, Haocheng, et al.
Pubblicazione: (2024)
SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and Music Synthesis
di: Baoueb, Teysir, et al.
Pubblicazione: (2024)
di: Baoueb, Teysir, et al.
Pubblicazione: (2024)
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
di: Li, Haowen, et al.
Pubblicazione: (2026)
di: Li, Haowen, et al.
Pubblicazione: (2026)
Désentrelacement Fréquentiel Doux pour les Codecs Audio Neuronaux
di: Giniès, Benoît, et al.
Pubblicazione: (2025)
di: Giniès, Benoît, et al.
Pubblicazione: (2025)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Listening to Multi-talker Conversations: Modular and End-to-end Perspectives
di: Raj, Desh
Pubblicazione: (2024)
di: Raj, Desh
Pubblicazione: (2024)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
Timbre Difference Capturing in Anomalous Sound Detection
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
di: Tian, Haokun, et al.
Pubblicazione: (2025)
di: Tian, Haokun, et al.
Pubblicazione: (2025)
Timbre Perception, Representation, and its Neuroscientific Exploration: A Comprehensive Review
di: Zhang, Hong, et al.
Pubblicazione: (2024)
di: Zhang, Hong, et al.
Pubblicazione: (2024)
DIFFRENT: A Diffusion Model for Recording Environment Transfer of Speech
di: Im, Jaekwon, et al.
Pubblicazione: (2024)
di: Im, Jaekwon, et al.
Pubblicazione: (2024)
Music Style Transfer with Time-Varying Inversion of Diffusion Models
di: Li, Sifei, et al.
Pubblicazione: (2024)
di: Li, Sifei, et al.
Pubblicazione: (2024)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
di: Wu, Zhiyu, et al.
Pubblicazione: (2025)
di: Wu, Zhiyu, et al.
Pubblicazione: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
di: Ren, Zhao, et al.
Pubblicazione: (2025)
di: Ren, Zhao, et al.
Pubblicazione: (2025)
End-to-end multi-channel speaker extraction and binaural speech synthesis
di: Chi, Cheng, et al.
Pubblicazione: (2024)
di: Chi, Cheng, et al.
Pubblicazione: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Is Transfer Learning Necessary for Violin Transcription?
di: Peng, Yueh-Po, et al.
Pubblicazione: (2025)
di: Peng, Yueh-Po, et al.
Pubblicazione: (2025)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Transfer Learning with Pseudo Multi-Label Birdcall Classification for DS@GT BirdCLEF 2024
di: Miyaguchi, Anthony, et al.
Pubblicazione: (2024)
di: Miyaguchi, Anthony, et al.
Pubblicazione: (2024)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
di: Du, Zongyang, et al.
Pubblicazione: (2024)
di: Du, Zongyang, et al.
Pubblicazione: (2024)
Diff-MST: Differentiable Mixing Style Transfer
di: Vanka, Soumya Sai, et al.
Pubblicazione: (2024)
di: Vanka, Soumya Sai, et al.
Pubblicazione: (2024)
Transferable Adversarial Attacks on Audio Deepfake Detection
di: Farooq, Muhammad Umar, et al.
Pubblicazione: (2025)
di: Farooq, Muhammad Umar, et al.
Pubblicazione: (2025)
Diff-MSTC: A Mixing Style Transfer Prototype for Cubase
di: Vanka, Soumya Sai, et al.
Pubblicazione: (2024)
di: Vanka, Soumya Sai, et al.
Pubblicazione: (2024)
Joint Multi-scale Cross-lingual Speaking Style Transfer with Bidirectional Attention Mechanism for Automatic Dubbing
di: Li, Jingbei, et al.
Pubblicazione: (2023)
di: Li, Jingbei, et al.
Pubblicazione: (2023)
Zero-shot Cross-lingual Voice Transfer for TTS
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
Relative Transfer Matrix Estimator using Covariance Subtraction
di: Manamperi, Wageesha N., et al.
Pubblicazione: (2025)
di: Manamperi, Wageesha N., et al.
Pubblicazione: (2025)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
di: Guimarães, Heitor R., et al.
Pubblicazione: (2024)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2024)
End-to-End Multi-Task Learning for Adjustable Joint Noise Reduction and Hearing Loss Compensation
di: Gonzalez, Philippe, et al.
Pubblicazione: (2026)
di: Gonzalez, Philippe, et al.
Pubblicazione: (2026)
Accent-VITS:accent transfer for end-to-end TTS
di: Ma, Linhan, et al.
Pubblicazione: (2023)
di: Ma, Linhan, et al.
Pubblicazione: (2023)
Music2Fail: Transfer Music to Failed Recorder Style
di: Leong, Chon In, et al.
Pubblicazione: (2024)
di: Leong, Chon In, et al.
Pubblicazione: (2024)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
di: Baoueb, Teysir, et al.
Pubblicazione: (2025) -
Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models
di: Baoueb, Teysir, et al.
Pubblicazione: (2025) -
GLA-Grad: A Griffin-Lim Extended Waveform Generation Diffusion Model
di: Liu, Haocheng, et al.
Pubblicazione: (2024) -
SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and Music Synthesis
di: Baoueb, Teysir, et al.
Pubblicazione: (2024) -
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)