GMM-ResNet2: Ensemble of Group ResNet Networks for Synthetic Speech Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Lei, Zhenchun, Yan, Hui, Liu, Changhong, Zhou, Yong, Ma, Minglei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Two-Path GMM-ResNet and GMM-SENet for ASV Spoofing Detection
di: Lei, Zhenchun, et al.
Pubblicazione: (2024)
di: Lei, Zhenchun, et al.
Pubblicazione: (2024)
GMM-ResNext: Combining Generative and Discriminative Models for Speaker Verification
di: Yan, Hui, et al.
Pubblicazione: (2024)
di: Yan, Hui, et al.
Pubblicazione: (2024)
Automatic speech recognition for the Nepali language using CNN, bidirectional LSTM and ResNet
di: Dhakal, Manish, et al.
Pubblicazione: (2024)
di: Dhakal, Manish, et al.
Pubblicazione: (2024)
Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
Squeeze-and-Excite ResNet-Conformers for Sound Event Localization, Detection, and Distance Estimation for DCASE 2024 Challenge
di: Yeow, Jun Wei, et al.
Pubblicazione: (2024)
di: Yeow, Jun Wei, et al.
Pubblicazione: (2024)
RaD-Net: A Repairing and Denoising Network for Speech Signal Improvement
di: Liu, Mingshuai, et al.
Pubblicazione: (2024)
di: Liu, Mingshuai, et al.
Pubblicazione: (2024)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
TBDM-Net: Bidirectional Dense Networks with Gender Information for Speech Emotion Recognition
di: Striletchi, Vlad, et al.
Pubblicazione: (2024)
di: Striletchi, Vlad, et al.
Pubblicazione: (2024)
Speech Diarization and ASR with GMM
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
di: Lin, Zizhen, et al.
Pubblicazione: (2025)
di: Lin, Zizhen, et al.
Pubblicazione: (2025)
Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
di: Du, Chenpeng, et al.
Pubblicazione: (2021)
di: Du, Chenpeng, et al.
Pubblicazione: (2021)
Towards Ultra-Low-Power Neuromorphic Speech Enhancement with Spiking-FullSubNet
di: Hao, Xiang, et al.
Pubblicazione: (2024)
di: Hao, Xiang, et al.
Pubblicazione: (2024)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
PhiNet: Speaker Verification with Phonetic Interpretability
di: Ma, Yi, et al.
Pubblicazione: (2026)
di: Ma, Yi, et al.
Pubblicazione: (2026)
TF-CorrNet: Leveraging Spatial Correlation for Continuous Speech Separation
di: Shin, Ui-Hyeop, et al.
Pubblicazione: (2025)
di: Shin, Ui-Hyeop, et al.
Pubblicazione: (2025)
Point to the Hidden: Exposing Speech Audio Splicing via Signal Pointer Nets
di: Moussa, Denise, et al.
Pubblicazione: (2023)
di: Moussa, Denise, et al.
Pubblicazione: (2023)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021
di: Chen, Xinhui, et al.
Pubblicazione: (2021)
di: Chen, Xinhui, et al.
Pubblicazione: (2021)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
RaD-Net 2: A causal two-stage repairing and denoising speech enhancement network with knowledge distillation and complex axial self-attention
di: Liu, Mingshuai, et al.
Pubblicazione: (2024)
di: Liu, Mingshuai, et al.
Pubblicazione: (2024)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics
di: Oh, Heewon
Pubblicazione: (2026)
di: Oh, Heewon
Pubblicazione: (2026)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
di: Chen, Junyang, et al.
Pubblicazione: (2026)
di: Chen, Junyang, et al.
Pubblicazione: (2026)
WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
di: Tran, Minh, et al.
Pubblicazione: (2025)
di: Tran, Minh, et al.
Pubblicazione: (2025)
BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement
di: Ye, Zhe, et al.
Pubblicazione: (2026)
di: Ye, Zhe, et al.
Pubblicazione: (2026)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025)
di: Garg, Ashi, et al.
Pubblicazione: (2025)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025)
di: Yang, Yujie, et al.
Pubblicazione: (2025)
Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers
di: Fu, Linya, et al.
Pubblicazione: (2025)
di: Fu, Linya, et al.
Pubblicazione: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
The 1st SpeechWellness Challenge: Detecting Suicide Risk Among Adolescents
di: Wu, Wen, et al.
Pubblicazione: (2025)
di: Wu, Wen, et al.
Pubblicazione: (2025)
Augmenting Polish Automatic Speech Recognition System With Synthetic Data
di: Bondaruk, Łukasz, et al.
Pubblicazione: (2024)
di: Bondaruk, Łukasz, et al.
Pubblicazione: (2024)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Two-Path GMM-ResNet and GMM-SENet for ASV Spoofing Detection
di: Lei, Zhenchun, et al.
Pubblicazione: (2024) -
GMM-ResNext: Combining Generative and Discriminative Models for Speaker Verification
di: Yan, Hui, et al.
Pubblicazione: (2024) -
Automatic speech recognition for the Nepali language using CNN, bidirectional LSTM and ResNet
di: Dhakal, Manish, et al.
Pubblicazione: (2024) -
Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection
di: Fan, Cunhang, et al.
Pubblicazione: (2023) -
Squeeze-and-Excite ResNet-Conformers for Sound Event Localization, Detection, and Distance Estimation for DCASE 2024 Challenge
di: Yeow, Jun Wei, et al.
Pubblicazione: (2024)