Aligning Generative Speech Enhancement with Perceptual Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Haoyang, Hou, Nana, Hu, Yuchen, Yao, Jixun, Siniscalchi, Sabato Marco, Zhuang, Xuyi, Ye, Deheng, Yang, Wei, Chng, Eng Siong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
di: Li, Haoyang, et al.
Pubblicazione: (2024)
di: Li, Haoyang, et al.
Pubblicazione: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
di: Liu, Hexin, et al.
Pubblicazione: (2024)
di: Liu, Hexin, et al.
Pubblicazione: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2024)
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2024)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Noise-Aware Speech Separation with Contrastive Learning
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
di: Peng, Yizhou, et al.
Pubblicazione: (2025)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
di: Liu, Hexin, et al.
Pubblicazione: (2025)
di: Liu, Hexin, et al.
Pubblicazione: (2025)
Speech Separation using Neural Audio Codecs with Embedding Loss
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
di: Ho, Chun-Wei, et al.
Pubblicazione: (2025)
di: Ho, Chun-Wei, et al.
Pubblicazione: (2025)
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
Exploiting Foundation Models and Speech Enhancement for Parkinson's Disease Detection from Speech in Real-World Operative Conditions
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
NTU-NPU System for Voice Privacy 2024 Challenge
di: Kuzmin, Nikita, et al.
Pubblicazione: (2024)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2024)
Bayesian adaptive learning to latent variables via Variational Bayes and Maximum a Posteriori
di: Hu, Hu, et al.
Pubblicazione: (2024)
di: Hu, Hu, et al.
Pubblicazione: (2024)
Exploring Generative Error Correction for Dysarthric Speech Recognition
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)
di: Li, Yuxin, et al.
Pubblicazione: (2025)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025)
di: Yen, Hao, et al.
Pubblicazione: (2025)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
di: Chen, Weiguang, et al.
Pubblicazione: (2025)
di: Chen, Weiguang, et al.
Pubblicazione: (2025)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
di: Yuhang, Yang, et al.
Pubblicazione: (2024)
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
di: Ho, Chun-wei, et al.
Pubblicazione: (2026)
di: Ho, Chun-wei, et al.
Pubblicazione: (2026)
NPU-NTU System for Voice Privacy 2024 Challenge
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
di: Liu, Changsong, et al.
Pubblicazione: (2025)
di: Liu, Changsong, et al.
Pubblicazione: (2025)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2025)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2025)
Bilingual Dual-Head Deep Model for Parkinson's Disease Detection from Speech
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Towards Audio Codec-based Speech Separation
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2024)
di: Chao, Rong, et al.
Pubblicazione: (2024)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
di: Yen, Hao, et al.
Pubblicazione: (2026)
di: Yen, Hao, et al.
Pubblicazione: (2026)
URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Dataset-Distillation Generative Model for Speech Emotion Recognition
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2024)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
di: Li, Haoyang, et al.
Pubblicazione: (2024) -
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025) -
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025) -
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
di: Hu, Yuchen, et al.
Pubblicazione: (2023) -
GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model
di: Li, Haoyang, et al.
Pubblicazione: (2025)