SLICE: Speech Enhancement via Layer-wise Injection of Conditioning Embeddings
Fuente:
arXiv
Salvato in:
| Autori principali: | Moon, Seokhoon, Jung, Kyudan, Choo, Jaegul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
Evaluating Automatic Speech Recognition Systems for Korean Meteorological Experts
di: Park, ChaeHun, et al.
Pubblicazione: (2024)
di: Park, ChaeHun, et al.
Pubblicazione: (2024)
MathReader : Text-to-Speech for Mathematical Documents
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)
di: Cooper, Erica, et al.
Pubblicazione: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
Enhancing ASR Performance through OCR Word Frequency Analysis: Theoretical Foundations
di: Jung, Kyudan, et al.
Pubblicazione: (2024)
di: Jung, Kyudan, et al.
Pubblicazione: (2024)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
DISPATCH: Distilling Selective Patches for Speech Enhancement
di: Kim, Dohwan, et al.
Pubblicazione: (2025)
di: Kim, Dohwan, et al.
Pubblicazione: (2025)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
di: Huang, Ziling, et al.
Pubblicazione: (2025)
di: Huang, Ziling, et al.
Pubblicazione: (2025)
Universal Discrete-Domain Speech Enhancement
di: Liu, Fei, et al.
Pubblicazione: (2025)
di: Liu, Fei, et al.
Pubblicazione: (2025)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
di: Chen, Youjun, et al.
Pubblicazione: (2026)
di: Chen, Youjun, et al.
Pubblicazione: (2026)
Flowing Straighter with Conditional Flow Matching for Accurate Speech Enhancement
di: Cross, Mattias, et al.
Pubblicazione: (2025)
di: Cross, Mattias, et al.
Pubblicazione: (2025)
Toward Universal Speech Enhancement for Diverse Input Conditions
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
di: Serre, Thomas, et al.
Pubblicazione: (2026)
di: Serre, Thomas, et al.
Pubblicazione: (2026)
Which Data Matter? Embedding-Based Data Selection for Speech Recognition
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2026)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2026)
Diffusion-based Frameworks for Unsupervised Speech Enhancement
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2026)
di: Ayilo, Jean-Eudes, et al.
Pubblicazione: (2026)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
A Probabilistic Generative Model for Spectral Speech Enhancement
di: Hidalgo-Araya, Marco, et al.
Pubblicazione: (2026)
di: Hidalgo-Araya, Marco, et al.
Pubblicazione: (2026)
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models
di: Khanagha, Sina, et al.
Pubblicazione: (2026)
di: Khanagha, Sina, et al.
Pubblicazione: (2026)
ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec
di: Liu, Fei, et al.
Pubblicazione: (2026)
di: Liu, Fei, et al.
Pubblicazione: (2026)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
Robust One-step Speech Enhancement via Consistency Distillation
di: Xu, Liang, et al.
Pubblicazione: (2025)
di: Xu, Liang, et al.
Pubblicazione: (2025)
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
di: Ueda, Lucas H., et al.
Pubblicazione: (2026)
di: Ueda, Lucas H., et al.
Pubblicazione: (2026)
Rethinking Training Targets, Architectures and Data Quality for Universal Speech Enhancement
di: Fu, Szu-Wei, et al.
Pubblicazione: (2026)
di: Fu, Szu-Wei, et al.
Pubblicazione: (2026)
VibOmni: Towards Scalable Bone-conduction Speech Enhancement on Earables
di: He, Lixing, et al.
Pubblicazione: (2025)
di: He, Lixing, et al.
Pubblicazione: (2025)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
di: Chen, Yanan, et al.
Pubblicazione: (2024)
di: Chen, Yanan, et al.
Pubblicazione: (2024)
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
Personalized Speech Enhancement Without a Separate Speaker Embedding Model
di: Pärnamaa, Tanel, et al.
Pubblicazione: (2024)
di: Pärnamaa, Tanel, et al.
Pubblicazione: (2024)
TASLA: Text-Aligned Speech Tokens with Multiple Layer-Aggregation
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2025)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
di: Jung, Kyudan, et al.
Pubblicazione: (2026) -
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
di: Jung, Kyudan, et al.
Pubblicazione: (2026) -
Evaluating Automatic Speech Recognition Systems for Korean Meteorological Experts
di: Park, ChaeHun, et al.
Pubblicazione: (2024) -
MathReader : Text-to-Speech for Mathematical Documents
di: Hyeon, Sieun, et al.
Pubblicazione: (2025) -
Improving Design of Input Condition Invariant Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)