SegINR: Segment-wise Implicit Neural Representation for Sequence Alignment in Neural Text-to-Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Minchan, Jeong, Myeonghun, Lee, Joun Yeop, Kim, Nam Soo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
di: Kim, Minchan, et al.
Pubblicazione: (2024)
di: Kim, Minchan, et al.
Pubblicazione: (2024)
Efficient Parallel Audio Generation using Group Masked Language Modeling
di: Jeong, Myeonghun, et al.
Pubblicazione: (2024)
di: Jeong, Myeonghun, et al.
Pubblicazione: (2024)
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
di: Lee, Joun Yeop, et al.
Pubblicazione: (2024)
di: Lee, Joun Yeop, et al.
Pubblicazione: (2024)
MakeSinger: A Semi-Supervised Training Method for Data-Efficient Singing Voice Synthesis via Classifier-free Diffusion Guidance
di: Kim, Semin, et al.
Pubblicazione: (2024)
di: Kim, Semin, et al.
Pubblicazione: (2024)
Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)
FastEnhancer: Speed-Optimized Streaming Neural Speech Enhancement
di: Ahn, Sunghwan, et al.
Pubblicazione: (2025)
di: Ahn, Sunghwan, et al.
Pubblicazione: (2025)
Latent Filling: Latent Space Data Augmentation for Zero-shot Speech Synthesis
di: Bae, Jae-Sung, et al.
Pubblicazione: (2023)
di: Bae, Jae-Sung, et al.
Pubblicazione: (2023)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
di: Kim, Semin, et al.
Pubblicazione: (2026)
di: Kim, Semin, et al.
Pubblicazione: (2026)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
di: Kim, Jaehyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaehyeon, et al.
Pubblicazione: (2024)
Rethinking Non-Negative Matrix Factorization with Implicit Neural Representations
di: Subramani, Krishna, et al.
Pubblicazione: (2024)
di: Subramani, Krishna, et al.
Pubblicazione: (2024)
SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment
di: Eom, SooHwan, et al.
Pubblicazione: (2026)
di: Eom, SooHwan, et al.
Pubblicazione: (2026)
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)
Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation
di: Cheng, Ming, et al.
Pubblicazione: (2024)
di: Cheng, Ming, et al.
Pubblicazione: (2024)
Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2024)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2024)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
Patient-Aware Feature Alignment for Robust Lung Sound Classification:Cohesion-Separation and Global Alignment Losses
di: Jeong, Seung Gyu, et al.
Pubblicazione: (2025)
di: Jeong, Seung Gyu, et al.
Pubblicazione: (2025)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
di: Ahn, Sunghwan, et al.
Pubblicazione: (2024)
di: Ahn, Sunghwan, et al.
Pubblicazione: (2024)
FxSearcher: gradient-free text-driven audio transformation
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
di: Yang, Jinhyeok, et al.
Pubblicazione: (2026)
di: Yang, Jinhyeok, et al.
Pubblicazione: (2026)
From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding
di: Yi, Jayeon, et al.
Pubblicazione: (2026)
di: Yi, Jayeon, et al.
Pubblicazione: (2026)
TASU: Text-Only Alignment for Speech Understanding
di: Peng, Jing, et al.
Pubblicazione: (2025)
di: Peng, Jing, et al.
Pubblicazione: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
Combolutional Neural Networks
di: Churchwell, Cameron, et al.
Pubblicazione: (2025)
di: Churchwell, Cameron, et al.
Pubblicazione: (2025)
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
di: Halimeh, Mhd Modar, et al.
Pubblicazione: (2025)
di: Halimeh, Mhd Modar, et al.
Pubblicazione: (2025)
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
di: Kim, Hyeongju, et al.
Pubblicazione: (2025)
di: Kim, Hyeongju, et al.
Pubblicazione: (2025)
Knowledge Distillation for Speech Denoising by Latent Representation Alignment with Cosine Distance
di: Luong, Diep, et al.
Pubblicazione: (2025)
di: Luong, Diep, et al.
Pubblicazione: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
CONMOD: Controllable Neural Frame-based Modulation Effects
di: Lee, Gyubin, et al.
Pubblicazione: (2024)
di: Lee, Gyubin, et al.
Pubblicazione: (2024)
Neural Speech Extraction with Human Feedback
di: Itani, Malek, et al.
Pubblicazione: (2025)
di: Itani, Malek, et al.
Pubblicazione: (2025)
ASTRA: Aligning Speech and Text Representations for Asr without Sampling
di: Gaur, Neeraj, et al.
Pubblicazione: (2024)
di: Gaur, Neeraj, et al.
Pubblicazione: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement
di: Wang, Tingting, et al.
Pubblicazione: (2024)
di: Wang, Tingting, et al.
Pubblicazione: (2024)
Disentangling Textual and Acoustic Features of Neural Speech Representations
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings
di: Li, Li, et al.
Pubblicazione: (2025)
di: Li, Li, et al.
Pubblicazione: (2025)
Latent-Domain Predictive Neural Speech Coding
di: Jiang, Xue, et al.
Pubblicazione: (2022)
di: Jiang, Xue, et al.
Pubblicazione: (2022)
TTA: Transcribe, Translate and Alignment for Cross-lingual Speech Representation
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations
di: Kim, Seungmin, et al.
Pubblicazione: (2025)
di: Kim, Seungmin, et al.
Pubblicazione: (2025)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
di: Kim, Minchan, et al.
Pubblicazione: (2024) -
Efficient Parallel Audio Generation using Group Masked Language Modeling
di: Jeong, Myeonghun, et al.
Pubblicazione: (2024) -
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
di: Lee, Joun Yeop, et al.
Pubblicazione: (2024) -
MakeSinger: A Semi-Supervised Training Method for Data-Efficient Singing Voice Synthesis via Classifier-free Diffusion Guidance
di: Kim, Semin, et al.
Pubblicazione: (2024) -
Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)