Enregistré dans:
| Auteurs principaux: | Ren, Zhao, Scheck, Kevin, Hou, Qinhan, van Gogh, Stefano, Wand, Michael, Schultz, Tanja |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2405.08021 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Machine Unlearning in Speech Emotion Recognition via Forget Set Alone
par: Ren, Zhao, et autres
Publié: (2025)
par: Ren, Zhao, et autres
Publié: (2025)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
par: Ren, Zhao, et autres
Publié: (2025)
par: Ren, Zhao, et autres
Publié: (2025)
Deep Speech Synthesis from Multimodal Articulatory Representations
par: Wu, Peter, et autres
Publié: (2024)
par: Wu, Peter, et autres
Publié: (2024)
Investigating Effective Speaker Property Privacy Protection in Federated Learning for Speech Emotion Recognition
par: Tan, Chao, et autres
Publié: (2024)
par: Tan, Chao, et autres
Publié: (2024)
Speech as a Biomarker for Disease Detection
par: Botelho, Catarina, et autres
Publié: (2024)
par: Botelho, Catarina, et autres
Publié: (2024)
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025)
par: Feng, Fuyuan, et autres
Publié: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
par: wu, Weihao, et autres
Publié: (2025)
par: wu, Weihao, et autres
Publié: (2025)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
par: Chen, Xueyuan, et autres
Publié: (2025)
par: Chen, Xueyuan, et autres
Publié: (2025)
Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation
par: Chang, Yi, et autres
Publié: (2024)
par: Chang, Yi, et autres
Publié: (2024)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
par: Li, Yuke, et autres
Publié: (2024)
par: Li, Yuke, et autres
Publié: (2024)
DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform Generation
par: Benita, Roi, et autres
Publié: (2023)
par: Benita, Roi, et autres
Publié: (2023)
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
par: Hu, Yifan, et autres
Publié: (2025)
par: Hu, Yifan, et autres
Publié: (2025)
Affect Decoding in Phonated and Silent Speech Production from Surface EMG
par: Pistrosch, Simon, et autres
Publié: (2026)
par: Pistrosch, Simon, et autres
Publié: (2026)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
par: Hou, Yixuan, et autres
Publié: (2025)
par: Hou, Yixuan, et autres
Publié: (2025)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
An Explainable Probabilistic Attribute Embedding Approach for Spoofed Speech Characterization
par: Chhibber, Manasi, et autres
Publié: (2024)
par: Chhibber, Manasi, et autres
Publié: (2024)
Freeze and Learn: Continual Learning with Selective Freezing for Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
DiffAU: Diffusion-Based Ambisonics Upscaling
par: Milstein, Amit, et autres
Publié: (2025)
par: Milstein, Amit, et autres
Publié: (2025)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Variational Autoencoder for Personalized Pathological Speech Enhancement
par: Hou, Mingchi, et autres
Publié: (2025)
par: Hou, Mingchi, et autres
Publié: (2025)
EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data
par: Prabhu, Navin Raj, et autres
Publié: (2023)
par: Prabhu, Navin Raj, et autres
Publié: (2023)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
par: Biyani, Ishan D., et autres
Publié: (2025)
par: Biyani, Ishan D., et autres
Publié: (2025)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
par: Bargum, Anders R., et autres
Publié: (2024)
par: Bargum, Anders R., et autres
Publié: (2024)
Source Verification for Speech Deepfakes
par: Negroni, Viola, et autres
Publié: (2025)
par: Negroni, Viola, et autres
Publié: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
par: de Groot, Dimme, et autres
Publié: (2025)
par: de Groot, Dimme, et autres
Publié: (2025)
Absorbing Discrete Diffusion for Speech Enhancement
par: Gonzalez, Philippe
Publié: (2026)
par: Gonzalez, Philippe
Publié: (2026)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
par: Richter, Julius, et autres
Publié: (2025)
par: Richter, Julius, et autres
Publié: (2025)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
par: Byun, Kyungguen, et autres
Publié: (2024)
par: Byun, Kyungguen, et autres
Publié: (2024)
Conformer-based Ultrasound-to-Speech Conversion
par: Ibrahimov, Ibrahim, et autres
Publié: (2025)
par: Ibrahimov, Ibrahim, et autres
Publié: (2025)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
par: Xue, Ke, et autres
Publié: (2026)
par: Xue, Ke, et autres
Publié: (2026)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
par: Liang, Ziqi, et autres
Publié: (2024)
par: Liang, Ziqi, et autres
Publié: (2024)
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
par: Pritzen, Julia, et autres
Publié: (2021)
par: Pritzen, Julia, et autres
Publié: (2021)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Documents similaires
-
Machine Unlearning in Speech Emotion Recognition via Forget Set Alone
par: Ren, Zhao, et autres
Publié: (2025) -
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
par: Ren, Zhao, et autres
Publié: (2025) -
Deep Speech Synthesis from Multimodal Articulatory Representations
par: Wu, Peter, et autres
Publié: (2024) -
Investigating Effective Speaker Property Privacy Protection in Federated Learning for Speech Emotion Recognition
par: Tan, Chao, et autres
Publié: (2024) -
Speech as a Biomarker for Disease Detection
par: Botelho, Catarina, et autres
Publié: (2024)