Latent-Domain Predictive Neural Speech Coding
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Xue, Peng, Xiulian, Xue, Huaying, Zhang, Yuan, Lu, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
di: Jiang, Xue, et al.
Pubblicazione: (2025)
di: Jiang, Xue, et al.
Pubblicazione: (2025)
Convert and Speak: Zero-shot Accent Conversion with Minimum Supervision
di: Jia, Zhijun, et al.
Pubblicazione: (2024)
di: Jia, Zhijun, et al.
Pubblicazione: (2024)
Text-Queried Audio Source Separation via Hierarchical Modeling
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
Masked Audio Modeling with CLAP and Multi-Objective Learning
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Causal Self-supervised Pretrained Frontend with Predictive Code for Speech Separation
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
Learning to Upsample and Upmix Audio in the Latent Domain
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
di: Yang, Yudong, et al.
Pubblicazione: (2024)
di: Yang, Yudong, et al.
Pubblicazione: (2024)
Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation
di: Lu, Cheng, et al.
Pubblicazione: (2024)
di: Lu, Cheng, et al.
Pubblicazione: (2024)
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
di: Lin, Weiwei, et al.
Pubblicazione: (2024)
di: Lin, Weiwei, et al.
Pubblicazione: (2024)
Knowledge Distillation for Speech Denoising by Latent Representation Alignment with Cosine Distance
di: Luong, Diep, et al.
Pubblicazione: (2025)
di: Luong, Diep, et al.
Pubblicazione: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
di: Gupta, Kishan, et al.
Pubblicazione: (2022)
di: Gupta, Kishan, et al.
Pubblicazione: (2022)
Neural Speech Extraction with Human Feedback
di: Itani, Malek, et al.
Pubblicazione: (2025)
di: Itani, Malek, et al.
Pubblicazione: (2025)
Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation
di: Lashkarashvili, Nineli, et al.
Pubblicazione: (2024)
di: Lashkarashvili, Nineli, et al.
Pubblicazione: (2024)
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
MiSTR: Multi-Modal iEEG-to-Speech Synthesis with Transformer-Based Prosody Prediction and Neural Phase Reconstruction
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2025)
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2025)
Aligned Contrastive Predictive Coding
di: Chorowski, Jan, et al.
Pubblicazione: (2021)
di: Chorowski, Jan, et al.
Pubblicazione: (2021)
Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
Domain Adapting Deep Reinforcement Learning for Real-world Speech Emotion Recognition
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2022)
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2022)
Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion Recognition
di: Ma, Yujian, et al.
Pubblicazione: (2025)
di: Ma, Yujian, et al.
Pubblicazione: (2025)
Music Emotion Prediction Using Recurrent Neural Networks
di: Chang, Xinyu, et al.
Pubblicazione: (2024)
di: Chang, Xinyu, et al.
Pubblicazione: (2024)
TF-MLPNet: Tiny Real-Time Neural Speech Separation
di: Itani, Malek, et al.
Pubblicazione: (2025)
di: Itani, Malek, et al.
Pubblicazione: (2025)
Quantifying Quanvolutional Neural Networks Robustness for Speech in Healthcare Applications
di: Tran, Ha, et al.
Pubblicazione: (2026)
di: Tran, Ha, et al.
Pubblicazione: (2026)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Dynamic Gated Recurrent Neural Network for Compute-efficient Speech Enhancement
di: Cheng, Longbiao, et al.
Pubblicazione: (2024)
di: Cheng, Longbiao, et al.
Pubblicazione: (2024)
Vision-Integrated High-Quality Neural Speech Coding
di: Guo, Yao, et al.
Pubblicazione: (2025)
di: Guo, Yao, et al.
Pubblicazione: (2025)
Reverse-Speech-Finder: A Neural Network Backtracking Architecture for Generating Alzheimer's Disease Speech Samples and Improving Diagnosis Performance
di: Li, Victor OK, et al.
Pubblicazione: (2025)
di: Li, Victor OK, et al.
Pubblicazione: (2025)
Deep Learning-based Non-Intrusive Multi-Objective Speech Assessment Model with Cross-Domain Features
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2021)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2021)
Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
Non-Intrusive Speech Intelligibility Prediction for Hearing Aids using Whisper and Metadata
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
Dynamic-SUPERB: Towards A Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark for Speech
di: Huang, Chien-yu, et al.
Pubblicazione: (2023)
di: Huang, Chien-yu, et al.
Pubblicazione: (2023)
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition
di: Chen, Chengxin, et al.
Pubblicazione: (2024)
di: Chen, Chengxin, et al.
Pubblicazione: (2024)
Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models
di: Feng, Chen, et al.
Pubblicazione: (2025)
di: Feng, Chen, et al.
Pubblicazione: (2025)
WhiSQA: Non-Intrusive Speech Quality Prediction Using Whisper Encoder Features
di: Close, George, et al.
Pubblicazione: (2025)
di: Close, George, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023) -
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
di: Jiang, Xue, et al.
Pubblicazione: (2025) -
Convert and Speak: Zero-shot Accent Conversion with Minimum Supervision
di: Jia, Zhijun, et al.
Pubblicazione: (2024) -
Text-Queried Audio Source Separation via Hierarchical Modeling
di: Yin, Xinlei, et al.
Pubblicazione: (2025) -
Masked Audio Modeling with CLAP and Multi-Objective Learning
di: Xin, Yifei, et al.
Pubblicazione: (2024)