An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Yicheng, Zhang, Xueyao, Xue, Liumeng, Li, Haizhou, Wu, Zhizheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MusicHiFi: Fast High-Fidelity Stereo Vocoding
par: Zhu, Ge, et autres
Publié: (2024)
par: Zhu, Ge, et autres
Publié: (2024)
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
Aliasing-Free Neural Audio Synthesis
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
An Initial Investigation of Neural Replay Simulator for Over-the-Air Adversarial Perturbations to Automatic Speaker Verification
par: Li, Jiaqi, et autres
Publié: (2023)
par: Li, Jiaqi, et autres
Publié: (2023)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
par: Chen, Shaowen, et autres
Publié: (2025)
par: Chen, Shaowen, et autres
Publié: (2025)
Real-Time Streaming Mel Vocoding with Generative Flow Matching
par: Welker, Simon, et autres
Publié: (2025)
par: Welker, Simon, et autres
Publié: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Neurodyne: Neural Pitch Manipulation with Representation Learning and Cycle-Consistency GAN
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
par: Meng, Hanyu, et autres
Publié: (2025)
par: Meng, Hanyu, et autres
Publié: (2025)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
par: Xue, Liumeng, et autres
Publié: (2024)
par: Xue, Liumeng, et autres
Publié: (2024)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
par: Yang, Ningyuan, et autres
Publié: (2026)
par: Yang, Ningyuan, et autres
Publié: (2026)
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
par: Gu, Yicheng, et autres
Publié: (2024)
par: Gu, Yicheng, et autres
Publié: (2024)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
par: Qi, Tianhua, et autres
Publié: (2026)
par: Qi, Tianhua, et autres
Publié: (2026)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
RIFT: Entropy-Optimised Fractional Wavelet Constellations for Ideal Time-Frequency Estimation
par: Cozens, James M., et autres
Publié: (2025)
par: Cozens, James M., et autres
Publié: (2025)
Wavelet-Based Time-Frequency Fingerprinting for Feature Extraction of Traditional Irish Music
par: Shore, Noah
Publié: (2025)
par: Shore, Noah
Publié: (2025)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
par: Liao, Yuan, et autres
Publié: (2025)
par: Liao, Yuan, et autres
Publié: (2025)
Learnable Adaptive Time-Frequency Representation via Differentiable Short-Time Fourier Transform
par: Leiber, Maxime, et autres
Publié: (2025)
par: Leiber, Maxime, et autres
Publié: (2025)
PeriodGrad: Towards Pitch-Controllable Neural Vocoder Based on a Diffusion Probabilistic Model
par: Hono, Yukiya, et autres
Publié: (2024)
par: Hono, Yukiya, et autres
Publié: (2024)
UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching
par: Choi, Woongjib, et autres
Publié: (2025)
par: Choi, Woongjib, et autres
Publié: (2025)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
A Machine Hearing System for Robust Cough Detection Based on a High-Level Representation of Band-Specific Audio Features
par: Monge-Alvarez, Jesús, et autres
Publié: (2024)
par: Monge-Alvarez, Jesús, et autres
Publié: (2024)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
Comparison of Frequency-Fusion Mechanisms for Binaural Direction-of-Arrival Estimation for Multiple Speakers
par: Fejgin, Daniel, et autres
Publié: (2024)
par: Fejgin, Daniel, et autres
Publié: (2024)
Phase-Based Signal Representations for Scattering
par: Haider, Daniel, et autres
Publié: (2022)
par: Haider, Daniel, et autres
Publié: (2022)
A Robust Method for Pitch Tracking in the Frequency Following Response using Harmonic Amplitude Summation Filterbank
par: Sadeghkhani, Sajad, et autres
Publié: (2025)
par: Sadeghkhani, Sajad, et autres
Publié: (2025)
Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
par: Maghsoudi, Maryam, et autres
Publié: (2026)
par: Maghsoudi, Maryam, et autres
Publié: (2026)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
par: Premananth, Gowtham, et autres
Publié: (2024)
par: Premananth, Gowtham, et autres
Publié: (2024)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)
par: Sato, Hiroshi, et autres
Publié: (2025)
Joint Fullband-Subband Modeling for High-Resolution SingFake Detection
par: Chen, Xuanjun, et autres
Publié: (2026)
par: Chen, Xuanjun, et autres
Publié: (2026)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
par: Shi, Runwu, et autres
Publié: (2024)
par: Shi, Runwu, et autres
Publié: (2024)
Future Full-Ocean Deep SSPs Prediction based on Hierarchical Long Short-Term Memory Neural Networks
par: Lu, Jiajun, et autres
Publié: (2023)
par: Lu, Jiajun, et autres
Publié: (2023)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
par: Yoneyama, Reo, et autres
Publié: (2025)
par: Yoneyama, Reo, et autres
Publié: (2025)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
par: Yan, Haoyin, et autres
Publié: (2024)
par: Yan, Haoyin, et autres
Publié: (2024)
FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
par: Hao, Xiang, et autres
Publié: (2020)
par: Hao, Xiang, et autres
Publié: (2020)
A Multimodal Data Fusion Attention-Empowered Generative Adversarial Network for Real Time 3D Underwater Sound Speed Field Construction
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Neural Vocoders as Speech Enhancers
par: Li, Andong, et autres
Publié: (2025)
par: Li, Andong, et autres
Publié: (2025)
Documents similaires
-
MusicHiFi: Fast High-Fidelity Stereo Vocoding
par: Zhu, Ge, et autres
Publié: (2024) -
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
par: Gu, Yicheng, et autres
Publié: (2025) -
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
par: Zhang, Xueyao, et autres
Publié: (2023) -
Aliasing-Free Neural Audio Synthesis
par: Gu, Yicheng, et autres
Publié: (2025) -
An Initial Investigation of Neural Replay Simulator for Over-the-Air Adversarial Perturbations to Automatic Speaker Verification
par: Li, Jiaqi, et autres
Publié: (2023)