MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Pengcheng, Wang, Jianzong, Zhang, Xulong, Zhang, Yong, Xiao, Jing, Cheng, Ning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Improvement for Audio Large Language Model using Unlabeled Speech
di: Wang, Shaowen, et al.
Pubblicazione: (2025)
di: Wang, Shaowen, et al.
Pubblicazione: (2025)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
Generation of Musical Timbres using a Text-Guided Diffusion Model
di: Yuan, Weixuan, et al.
Pubblicazione: (2025)
di: Yuan, Weixuan, et al.
Pubblicazione: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
di: Donepudi, Dharma Teja
Pubblicazione: (2025)
di: Donepudi, Dharma Teja
Pubblicazione: (2025)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Window Size Versus Accuracy Experiments in Voice Activity Detectors
di: McKinnon, Max, et al.
Pubblicazione: (2026)
di: McKinnon, Max, et al.
Pubblicazione: (2026)
Taming Audio VAEs via Target-KL Regularization
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
di: Yi, Yungang, et al.
Pubblicazione: (2024)
di: Yi, Yungang, et al.
Pubblicazione: (2024)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
di: Opria, Joshua
Pubblicazione: (2026)
di: Opria, Joshua
Pubblicazione: (2026)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
Guitar Tone Morphing by Diffusion-based Model
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Bloodroot: When Watermarking Turns Poisonous For Stealthy Backdoor
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
di: Mehta, Shivam, et al.
Pubblicazione: (2024)
di: Mehta, Shivam, et al.
Pubblicazione: (2024)
M6(GPT)3: Generating Multitrack Modifiable Multi-Minute MIDI Music from Text using Genetic algorithms, Probabilistic methods and GPT Models in any Progression and Time Signature
di: Poćwiardowski, Jakub, et al.
Pubblicazione: (2024)
di: Poćwiardowski, Jakub, et al.
Pubblicazione: (2024)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
An audio-to-analysis pipeline with certified transcription for information-theoretic profiling of the piano repertoire
di: Jalbert-Desforges, Fred
Pubblicazione: (2026)
di: Jalbert-Desforges, Fred
Pubblicazione: (2026)
AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
di: Maben, Leander Melroy, et al.
Pubblicazione: (2025)
di: Maben, Leander Melroy, et al.
Pubblicazione: (2025)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
MaskClip: Detachable Clip-on Piezoelectric Sensing of Mask Surface Vibrations for Real-time Noise-Robust Speech Input
di: Hiraki, Hirotaka, et al.
Pubblicazione: (2025)
di: Hiraki, Hirotaka, et al.
Pubblicazione: (2025)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
di: Soni, Aniket Abhishek
Pubblicazione: (2025)
di: Soni, Aniket Abhishek
Pubblicazione: (2025)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
di: Kozak, Nazar
Pubblicazione: (2026)
di: Kozak, Nazar
Pubblicazione: (2026)
Matcha-TTS: A fast TTS architecture with conditional flow matching
di: Mehta, Shivam, et al.
Pubblicazione: (2023)
di: Mehta, Shivam, et al.
Pubblicazione: (2023)
Reciprocal Latent Fields for Precomputed Sound Propagation
di: Seuté, Hugo, et al.
Pubblicazione: (2026)
di: Seuté, Hugo, et al.
Pubblicazione: (2026)
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
di: Dhiman, Jai
Pubblicazione: (2026)
di: Dhiman, Jai
Pubblicazione: (2026)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
di: Marie, Ambre, et al.
Pubblicazione: (2025)
di: Marie, Ambre, et al.
Pubblicazione: (2025)
SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement
di: Wang, Zihao, et al.
Pubblicazione: (2024)
di: Wang, Zihao, et al.
Pubblicazione: (2024)
Prevailing Research Areas for Music AI in the Era of Foundation Models
di: Wei, Megan, et al.
Pubblicazione: (2024)
di: Wei, Megan, et al.
Pubblicazione: (2024)
OBHS: An Optimized Block Huffman Scheme for Real-Time Audio Compression
di: Mahfi, Muntahi Safwan, et al.
Pubblicazione: (2025)
di: Mahfi, Muntahi Safwan, et al.
Pubblicazione: (2025)
Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
Quantum-Enhanced Analysis and Grading of Vocal Performance
di: Agarwal, Rohan
Pubblicazione: (2025)
di: Agarwal, Rohan
Pubblicazione: (2025)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-Improvement for Audio Large Language Model using Unlabeled Speech
di: Wang, Shaowen, et al.
Pubblicazione: (2025) -
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025) -
Generation of Musical Timbres using a Text-Guided Diffusion Model
di: Yuan, Weixuan, et al.
Pubblicazione: (2025) -
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
di: Mehta, Shivam, et al.
Pubblicazione: (2025)