HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Shengkui, Zhou, Kun, Pan, Zexu, Ma, Yukun, Zhang, Chong, Ma, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
HiFi-Stream: Streaming Speech Enhancement with Generative Adversarial Networks
di: Dmitrieva, Ekaterina, et al.
Pubblicazione: (2025)
di: Dmitrieva, Ekaterina, et al.
Pubblicazione: (2025)
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation
di: Zhang, Chong, et al.
Pubblicazione: (2025)
di: Zhang, Chong, et al.
Pubblicazione: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
di: Zhao, Shengkui, et al.
Pubblicazione: (2021)
di: Zhao, Shengkui, et al.
Pubblicazione: (2021)
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding
di: Chary, Luis Felipe, et al.
Pubblicazione: (2025)
di: Chary, Luis Felipe, et al.
Pubblicazione: (2025)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
di: Zhao, Shengkui, et al.
Pubblicazione: (2022)
di: Zhao, Shengkui, et al.
Pubblicazione: (2022)
Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GAN
di: Morocutti, Tobias, et al.
Pubblicazione: (2026)
di: Morocutti, Tobias, et al.
Pubblicazione: (2026)
STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
di: Yuan, Jiajun, et al.
Pubblicazione: (2025)
di: Yuan, Jiajun, et al.
Pubblicazione: (2025)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
di: Zhu, Ge, et al.
Pubblicazione: (2024)
di: Zhu, Ge, et al.
Pubblicazione: (2024)
SPGM: Prioritizing Local Features for enhanced speech separation performance
di: Yip, Jia Qi, et al.
Pubblicazione: (2023)
di: Yip, Jia Qi, et al.
Pubblicazione: (2023)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
Phase Repair for Time-Domain Convolutional Neural Networks in Music Super-Resolution
di: Zhang, Yenan, et al.
Pubblicazione: (2023)
di: Zhang, Yenan, et al.
Pubblicazione: (2023)
Towards Audio Codec-based Speech Separation
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Speech Bandwidth Expansion Via High Fidelity Generative Adversarial Networks
di: Salhab, Mahmoud, et al.
Pubblicazione: (2024)
di: Salhab, Mahmoud, et al.
Pubblicazione: (2024)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
Context-Aware Two-Step Training Scheme for Domain Invariant Speech Separation
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
E2E-AEC: Implementing an end-to-end neural network learning approach for acoustic echo cancellation
di: Jiang, Yiheng, et al.
Pubblicazione: (2026)
di: Jiang, Yiheng, et al.
Pubblicazione: (2026)
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2026)
di: Pan, Zexu, et al.
Pubblicazione: (2026)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
STSM-FiLM: A FiLM-Conditioned Neural Architecture for Time-Scale Modification of Speech
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2025)
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2025)
UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
LuSeeL: Language-queried Binaural Universal Sound Event Extraction and Localization
di: Pan, Zexu, et al.
Pubblicazione: (2026)
di: Pan, Zexu, et al.
Pubblicazione: (2026)
FlashSR: One-step Versatile Audio Super-resolution via Diffusion Distillation
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
di: Nawfal, Ismael, et al.
Pubblicazione: (2025)
di: Nawfal, Ismael, et al.
Pubblicazione: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
High-Fidelity Simultaneous Speech-To-Speech Translation
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
Bridge-SR: Schrödinger Bridge for Efficient SR
di: Li, Chang, et al.
Pubblicazione: (2025)
di: Li, Chang, et al.
Pubblicazione: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025) -
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
di: Zhao, Shengkui, et al.
Pubblicazione: (2025) -
HiFi-Stream: Streaming Speech Enhancement with Generative Adversarial Networks
di: Dmitrieva, Ekaterina, et al.
Pubblicazione: (2025) -
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025) -
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
di: Gu, Yicheng, et al.
Pubblicazione: (2024)