Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Gállego, Gerard I., Fejgin, Roy, Yeh, Chunghsin, Liu, Xiaoyu, Bhattacharya, Gautam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Room Impulse Response Generation Conditioned on Acoustic Parameters
di: Arellano, Silvia, et al.
Pubblicazione: (2025)
di: Arellano, Silvia, et al.
Pubblicazione: (2025)
Exploiting an External Microphone for Binaural RTF-Vector-Based Direction of Arrival Estimation for Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
Completing Sets of Prototype Transfer Functions for Subspace-based Direction of Arrival Estimation of Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2025)
di: Fejgin, Daniel, et al.
Pubblicazione: (2025)
Joint Semantic Knowledge Distillation and Masked Acoustic Modeling for Full-band Speech Restoration with Improved Intelligibility
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
BRUDEX Database: Binaural Room Impulse Responses with Uniformly Distributed External Microphones
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
Comparison of Frequency-Fusion Mechanisms for Binaural Direction-of-Arrival Estimation for Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2024)
di: Fejgin, Daniel, et al.
Pubblicazione: (2024)
SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
di: Serre, Thomas, et al.
Pubblicazione: (2026)
di: Serre, Thomas, et al.
Pubblicazione: (2026)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2022)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
di: Namballa, Richa, et al.
Pubblicazione: (2025)
di: Namballa, Richa, et al.
Pubblicazione: (2025)
Aliasing-Free Neural Audio Synthesis
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Audio signal interpolation using optimal transportation of spectrograms
di: Valdivia, David, et al.
Pubblicazione: (2025)
di: Valdivia, David, et al.
Pubblicazione: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Towards Improved Objective Perceptual Audio Quality Assessment -- Part 1: A Novel Data-Driven Cognitive Model
di: Delgado, Pablo M., et al.
Pubblicazione: (2024)
di: Delgado, Pablo M., et al.
Pubblicazione: (2024)
Significance of Chirp MFCC as a Feature in Speech and Audio Applications
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)
di: Joysingh, S. Johanan, et al.
Pubblicazione: (2024)
Low-Complexity Neural Wind Noise Reduction for Audio Recordings
di: Eftekhari, Hesam, et al.
Pubblicazione: (2025)
di: Eftekhari, Hesam, et al.
Pubblicazione: (2025)
Beyond Identity: A Generalizable Approach for Deepfake Audio Detection
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025)
di: Ahmadiadli, Yasaman, et al.
Pubblicazione: (2025)
Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
di: Pascual, Santiago, et al.
Pubblicazione: (2024)
Generative Deep Learning and Signal Processing for Data Augmentation of Cardiac Auscultation Signals: Improving Model Robustness Using Synthetic Audio
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
Interpolation Filter Design for Sample Rate Independent Audio Effect RNNs
di: Carson, Alistair, et al.
Pubblicazione: (2024)
di: Carson, Alistair, et al.
Pubblicazione: (2024)
Sample Rate Independent Recurrent Neural Networks for Audio Effects Processing
di: Carson, Alistair, et al.
Pubblicazione: (2024)
di: Carson, Alistair, et al.
Pubblicazione: (2024)
Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners
di: Yuan, Ze, et al.
Pubblicazione: (2024)
di: Yuan, Ze, et al.
Pubblicazione: (2024)
Semantic Communications for Speech Recognition
di: Weng, Zhenzi, et al.
Pubblicazione: (2021)
di: Weng, Zhenzi, et al.
Pubblicazione: (2021)
Audio Compression using Periodic Gabor with Biorthogonal Exchange: Implementation Using the Zak Transform
di: Alimi, Roger, et al.
Pubblicazione: (2025)
di: Alimi, Roger, et al.
Pubblicazione: (2025)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
di: Liao, Yuan, et al.
Pubblicazione: (2025)
di: Liao, Yuan, et al.
Pubblicazione: (2025)
MaskSR: Masked Language Model for Full-band Speech Restoration
di: Li, Xu, et al.
Pubblicazione: (2024)
di: Li, Xu, et al.
Pubblicazione: (2024)
A Machine Hearing System for Robust Cough Detection Based on a High-Level Representation of Band-Specific Audio Features
di: Monge-Alvarez, Jesús, et al.
Pubblicazione: (2024)
di: Monge-Alvarez, Jesús, et al.
Pubblicazione: (2024)
FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
di: Hao, Xiang, et al.
Pubblicazione: (2020)
di: Hao, Xiang, et al.
Pubblicazione: (2020)
Assisted RTF-Vector-Based Binaural Direction of Arrival Estimation Exploiting a Calibrated External Microphone Array
di: Fejgin, Daniel, et al.
Pubblicazione: (2022)
di: Fejgin, Daniel, et al.
Pubblicazione: (2022)
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
DeWinder: Single-Channel Wind Noise Reduction using Ultrasound Sensing
di: Yuan, Kuang, et al.
Pubblicazione: (2024)
di: Yuan, Kuang, et al.
Pubblicazione: (2024)
Passive acoustic non-line-of-sight localization without a relay surface
di: Sommer, Tal I., et al.
Pubblicazione: (2025)
di: Sommer, Tal I., et al.
Pubblicazione: (2025)
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
di: Kawamura, Masaya, et al.
Pubblicazione: (2025)
di: Kawamura, Masaya, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Singing Voice Graph Modeling for SingFake Detection
di: Chen, Xuanjun, et al.
Pubblicazione: (2024)
di: Chen, Xuanjun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Room Impulse Response Generation Conditioned on Acoustic Parameters
di: Arellano, Silvia, et al.
Pubblicazione: (2025) -
Exploiting an External Microphone for Binaural RTF-Vector-Based Direction of Arrival Estimation for Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2023) -
Completing Sets of Prototype Transfer Functions for Subspace-based Direction of Arrival Estimation of Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2025) -
Joint Semantic Knowledge Distillation and Masked Acoustic Modeling for Full-band Speech Restoration with Improved Intelligibility
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024) -
BRUDEX Database: Binaural Room Impulse Responses with Uniformly Distributed External Microphones
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)