Guardado en:
| Autores principales: | Salhab, Mahmoud, Harmanani, Haidar |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2407.18571 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CIS-BWE: Chaos-Informed Speech Bandwidth Extension
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
por: Wen, Bin, et al.
Publicado: (2025)
por: Wen, Bin, et al.
Publicado: (2025)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
por: Jiao, Xinxin, et al.
Publicado: (2024)
por: Jiao, Xinxin, et al.
Publicado: (2024)
ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments
por: Alavilli, Sagarika, et al.
Publicado: (2024)
por: Alavilli, Sagarika, et al.
Publicado: (2024)
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
por: Wang, Chien-Chun, et al.
Publicado: (2024)
por: Wang, Chien-Chun, et al.
Publicado: (2024)
Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements
por: Dhar, Sandipan, et al.
Publicado: (2025)
por: Dhar, Sandipan, et al.
Publicado: (2025)
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
por: Dhar, Sandipan, et al.
Publicado: (2025)
por: Dhar, Sandipan, et al.
Publicado: (2025)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation
por: Wang, Tongxi, et al.
Publicado: (2025)
por: Wang, Tongxi, et al.
Publicado: (2025)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025)
por: Zhang, Kang, et al.
Publicado: (2025)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
por: Wang, Helin, et al.
Publicado: (2025)
por: Wang, Helin, et al.
Publicado: (2025)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)
por: Cao, Yubing, et al.
Publicado: (2025)
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
por: Lee, Ching Ho, et al.
Publicado: (2026)
por: Lee, Ching Ho, et al.
Publicado: (2026)
Incremental FastPitch: Chunk-based High Quality Text to Speech
por: Du, Muyang, et al.
Publicado: (2024)
por: Du, Muyang, et al.
Publicado: (2024)
Collaborative Watermarking for Adversarial Speech Synthesis
por: Juvela, Lauri, et al.
Publicado: (2023)
por: Juvela, Lauri, et al.
Publicado: (2023)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
por: Zhang, Jinming, et al.
Publicado: (2025)
por: Zhang, Jinming, et al.
Publicado: (2025)
Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation
por: Lam, Max W. Y., et al.
Publicado: (2025)
por: Lam, Max W. Y., et al.
Publicado: (2025)
Temporal Information Reconstruction and Non-Aligned Residual in Spiking Neural Networks for Speech Classification
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models
por: Chen, Sijing, et al.
Publicado: (2024)
por: Chen, Sijing, et al.
Publicado: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026)
por: Ni, Qinke, et al.
Publicado: (2026)
AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder
por: Sadok, Samir, et al.
Publicado: (2025)
por: Sadok, Samir, et al.
Publicado: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
por: Kim, Jaeyoung, et al.
Publicado: (2024)
por: Kim, Jaeyoung, et al.
Publicado: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
por: Wang, Yongqi, et al.
Publicado: (2023)
por: Wang, Yongqi, et al.
Publicado: (2023)
GEC-RAG: Improving Generative Error Correction via Retrieval-Augmented Generation for Automatic Speech Recognition Systems
por: Robatian, Amin, et al.
Publicado: (2025)
por: Robatian, Amin, et al.
Publicado: (2025)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
por: Lee, Yongjoon, et al.
Publicado: (2024)
por: Lee, Yongjoon, et al.
Publicado: (2024)
FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
por: Mai, Jialong, et al.
Publicado: (2025)
por: Mai, Jialong, et al.
Publicado: (2025)
Density Adaptive Attention-based Speech Network: Enhancing Feature Understanding for Mental Health Disorders
por: Ioannides, Georgios, et al.
Publicado: (2024)
por: Ioannides, Georgios, et al.
Publicado: (2024)
LLMs-Integrated Automatic Hate Speech Recognition Using Controllable Text Generation Models
por: Oshima, Ryutaro, et al.
Publicado: (2026)
por: Oshima, Ryutaro, et al.
Publicado: (2026)
Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches
por: Aboeitta, Ahmed, et al.
Publicado: (2025)
por: Aboeitta, Ahmed, et al.
Publicado: (2025)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
por: Ji, Zhoulin, et al.
Publicado: (2024)
por: Ji, Zhoulin, et al.
Publicado: (2024)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
por: Lau, Hok-Shing, et al.
Publicado: (2024)
por: Lau, Hok-Shing, et al.
Publicado: (2024)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
por: Wang, Helin, et al.
Publicado: (2025)
por: Wang, Helin, et al.
Publicado: (2025)
Ejemplares similares
-
CIS-BWE: Chaos-Informed Speech Bandwidth Extension
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025) -
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
por: Wen, Bin, et al.
Publicado: (2025) -
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025) -
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
por: Pan, Yu, et al.
Publicado: (2025) -
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
por: Lee, Seo-Hyun, et al.
Publicado: (2023)