Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation
Fuente:
arXiv
Guardado en:
| Autores principales: | Hsieh, Tsun-An, Choi, Heeyoul, Kim, Minje |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
Adaptive Deterministic Flow Matching for Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
A Comparative Analysis of Poetry Reading Audio: Singing, Narrating, or Somewhere In Between?
por: Choi, Kahyun, et al.
Publicado: (2024)
por: Choi, Kahyun, et al.
Publicado: (2024)
Towards Real-Time Generative Speech Restoration with Flow-Matching
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
Hyperbolic Distance-Based Speech Separation
por: Petermann, Darius, et al.
Publicado: (2024)
por: Petermann, Darius, et al.
Publicado: (2024)
From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding
por: Yi, Jayeon, et al.
Publicado: (2026)
por: Yi, Jayeon, et al.
Publicado: (2026)
PromptSep: Generative Audio Separation via Multimodal Prompting
por: Wen, Yutong, et al.
Publicado: (2025)
por: Wen, Yutong, et al.
Publicado: (2025)
Speech Separation using Neural Audio Codecs with Embedding Loss
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs
por: Kim, Minje, et al.
Publicado: (2024)
por: Kim, Minje, et al.
Publicado: (2024)
Perceptual Audio Coding: A 40-Year Historical Perspective
por: Herre, Jürgen, et al.
Publicado: (2025)
por: Herre, Jürgen, et al.
Publicado: (2025)
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
por: Lin, Jackie, et al.
Publicado: (2026)
por: Lin, Jackie, et al.
Publicado: (2026)
On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement
por: Hsieh, Tsun-An, et al.
Publicado: (2024)
por: Hsieh, Tsun-An, et al.
Publicado: (2024)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
User-guided Generative Source Separation
por: Wen, Yutong, et al.
Publicado: (2025)
por: Wen, Yutong, et al.
Publicado: (2025)
Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition
por: Ok, Seaone, et al.
Publicado: (2026)
por: Ok, Seaone, et al.
Publicado: (2026)
Separate and Reconstruct: Asymmetric Encoder-Decoder for Speech Separation
por: Shin, Ui-Hyeop, et al.
Publicado: (2024)
por: Shin, Ui-Hyeop, et al.
Publicado: (2024)
ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals
por: E, Ameenudeen P, et al.
Publicado: (2026)
por: E, Ameenudeen P, et al.
Publicado: (2026)
Text-aware Speech Separation for Multi-talker Keyword Spotting
por: Li, Haoyu, et al.
Publicado: (2024)
por: Li, Haoyu, et al.
Publicado: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
por: Giraldo, José, et al.
Publicado: (2024)
por: Giraldo, José, et al.
Publicado: (2024)
SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
por: Yang, Xiaoyu, et al.
Publicado: (2025)
por: Yang, Xiaoyu, et al.
Publicado: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
Ring Mixing with Auxiliary Signal-to-Consistency-Error Ratio Loss for Unsupervised Denoising in Speech Separation
por: Maciejewski, Matthew, et al.
Publicado: (2026)
por: Maciejewski, Matthew, et al.
Publicado: (2026)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
por: Kim, Jongsuk, et al.
Publicado: (2025)
por: Kim, Jongsuk, et al.
Publicado: (2025)
Adapting a Text-to-Audio Model for Room Impulse Response Generation
por: Kim, Kirak, et al.
Publicado: (2026)
por: Kim, Kirak, et al.
Publicado: (2026)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
por: Kim, Youngjae, et al.
Publicado: (2024)
por: Kim, Youngjae, et al.
Publicado: (2024)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
por: Kuznetsova, Anastasia, et al.
Publicado: (2025)
por: Kuznetsova, Anastasia, et al.
Publicado: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
por: Li, Guinan, et al.
Publicado: (2024)
por: Li, Guinan, et al.
Publicado: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement
por: Bae, Jae-Sung, et al.
Publicado: (2025)
por: Bae, Jae-Sung, et al.
Publicado: (2025)
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
por: Halimeh, Mhd Modar, et al.
Publicado: (2025)
por: Halimeh, Mhd Modar, et al.
Publicado: (2025)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024)
por: Lee, Dongheon, et al.
Publicado: (2024)
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
por: Yang, Mu, et al.
Publicado: (2025)
por: Yang, Mu, et al.
Publicado: (2025)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
por: Ho, Chun-wei, et al.
Publicado: (2026)
por: Ho, Chun-wei, et al.
Publicado: (2026)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
por: Miccini, Riccardo, et al.
Publicado: (2025)
por: Miccini, Riccardo, et al.
Publicado: (2025)
Transducer Consistency Regularization for Speech to Text Applications
por: Tseng, Cindy, et al.
Publicado: (2024)
por: Tseng, Cindy, et al.
Publicado: (2024)
Ejemplares similares
-
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025) -
Adaptive Deterministic Flow Matching for Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025) -
A Comparative Analysis of Poetry Reading Audio: Singing, Narrating, or Somewhere In Between?
por: Choi, Kahyun, et al.
Publicado: (2024) -
Towards Real-Time Generative Speech Restoration with Flow-Matching
por: Hsieh, Tsun-An, et al.
Publicado: (2025) -
Hyperbolic Distance-Based Speech Separation
por: Petermann, Darius, et al.
Publicado: (2024)