Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Renmingyue, Yao, Jixun, Kong, Qiuqiang, Cao, Yin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
di: Wu, Chun Yat, et al.
Pubblicazione: (2025)
di: Wu, Chun Yat, et al.
Pubblicazione: (2025)
Voice Timbre Attribute Detection with Compact and Interpretable Training-Free Acoustic Parameters
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2026)
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2026)
Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
di: Hu, Jinbo, et al.
Pubblicazione: (2023)
di: Hu, Jinbo, et al.
Pubblicazione: (2023)
Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction
di: Du, Hui-Peng, et al.
Pubblicazione: (2026)
di: Du, Hui-Peng, et al.
Pubblicazione: (2026)
ImmersiveFlow: Stereo-to-7.1.4 spatial audio generation with flow matching
di: Liang, Zining, et al.
Pubblicazione: (2026)
di: Liang, Zining, et al.
Pubblicazione: (2026)
A Distilled Low-Latency Neural Vocoder with Explicit Amplitude and Phase Prediction
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion
di: Ning, Ziqian, et al.
Pubblicazione: (2025)
di: Ning, Ziqian, et al.
Pubblicazione: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
Non-Causal to Causal SSL-Supported Transfer Learning: Towards a High-Performance Low-Latency Speech Vocoder
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
A Universal Harmonic Discriminator for High-quality GAN-based Vocoder
di: Xu, Nan, et al.
Pubblicazione: (2025)
di: Xu, Nan, et al.
Pubblicazione: (2025)
MUSA: Multi-lingual Speaker Anonymization via Serial Disentanglement
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Vocoder-Projected Feature Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
WavCraft: Audio Editing and Generation with Large Language Models
di: Liang, Jinhua, et al.
Pubblicazione: (2024)
di: Liang, Jinhua, et al.
Pubblicazione: (2024)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
di: Yang, Yudong, et al.
Pubblicazione: (2024)
di: Yang, Yudong, et al.
Pubblicazione: (2024)
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
MusicScore: A Dataset for Music Score Modeling and Generation
di: Lin, Yuheng, et al.
Pubblicazione: (2024)
di: Lin, Yuheng, et al.
Pubblicazione: (2024)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
FA-GAN: Artifacts-free and Phase-aware High-fidelity GAN-based Vocoder
di: Shen, Rubing, et al.
Pubblicazione: (2024)
di: Shen, Rubing, et al.
Pubblicazione: (2024)
A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
VNet: A GAN-based Multi-Tier Discriminator Network for Speech Synthesis Vocoders
di: Cao, Yubing, et al.
Pubblicazione: (2024)
di: Cao, Yubing, et al.
Pubblicazione: (2024)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
NPU-NTU System for Voice Privacy 2024 Challenge
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
di: Guo, Dake, et al.
Pubblicazione: (2025)
di: Guo, Dake, et al.
Pubblicazione: (2025)
Leveraging Self-Supervised Audio-Visual Pretrained Models to Improve Vocoded Speech Intelligibility in Cochlear Implant Simulation
di: Lai, Richard Lee, et al.
Pubblicazione: (2023)
di: Lai, Richard Lee, et al.
Pubblicazione: (2023)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
di: Zhu, Ge, et al.
Pubblicazione: (2024)
di: Zhu, Ge, et al.
Pubblicazione: (2024)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
di: Li, Xiquan, et al.
Pubblicazione: (2024)
di: Li, Xiquan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
di: Du, Hui-Peng, et al.
Pubblicazione: (2024) -
CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
di: Wu, Chun Yat, et al.
Pubblicazione: (2025) -
Voice Timbre Attribute Detection with Compact and Interpretable Training-Free Acoustic Parameters
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2026) -
Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?
di: Du, Hui-Peng, et al.
Pubblicazione: (2025) -
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
di: Hu, Jinbo, et al.
Pubblicazione: (2023)