An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guimarães, Heitor R., Pimentel, Arthur, Avila, Anderson R., Rezagholizadeh, Mehdi, Chen, Boxing, Falk, Tiago H. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications
par: Guimarães, Heitor R., et autres
Publié: (2026)
par: Guimarães, Heitor R., et autres
Publié: (2026)
AUDDT: Audio Unified Deepfake Detection Benchmark Toolkit
par: Zhu, Yi, et autres
Publié: (2025)
par: Zhu, Yi, et autres
Publié: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
End-to-End Multi-Task Learning for Adjustable Joint Noise Reduction and Hearing Loss Compensation
par: Gonzalez, Philippe, et autres
Publié: (2026)
par: Gonzalez, Philippe, et autres
Publié: (2026)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
UrBAN: Urban Beehive Acoustics and PheNotyping Dataset
par: Abdollahi, Mahsa, et autres
Publié: (2024)
par: Abdollahi, Mahsa, et autres
Publié: (2024)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
par: Ahmad, Hawraz A., et autres
Publié: (2024)
par: Ahmad, Hawraz A., et autres
Publié: (2024)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
par: Chen, Junyang, et autres
Publié: (2026)
par: Chen, Junyang, et autres
Publié: (2026)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
par: Farhadipour, Aref, et autres
Publié: (2023)
par: Farhadipour, Aref, et autres
Publié: (2023)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
par: Comanducci, Luca, et autres
Publié: (2024)
par: Comanducci, Luca, et autres
Publié: (2024)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
par: Lin, Wan, et autres
Publié: (2024)
par: Lin, Wan, et autres
Publié: (2024)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
par: Lee, Yongjoon, et autres
Publié: (2024)
par: Lee, Yongjoon, et autres
Publié: (2024)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms
par: Li, Sirui, et autres
Publié: (2025)
par: Li, Sirui, et autres
Publié: (2025)
End-to-End Diarization utilizing Attractor Deep Clustering
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
par: You, Zhenghai, et autres
Publié: (2025)
par: You, Zhenghai, et autres
Publié: (2025)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
par: Raimon, Athul, et autres
Publié: (2024)
par: Raimon, Athul, et autres
Publié: (2024)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
par: Plaquet, Alexis, et autres
Publié: (2025)
par: Plaquet, Alexis, et autres
Publié: (2025)
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
par: Chen, Jinming, et autres
Publié: (2024)
par: Chen, Jinming, et autres
Publié: (2024)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
par: Moslem, Yasmin
Publié: (2024)
par: Moslem, Yasmin
Publié: (2024)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
par: Kang, Wonjune, et autres
Publié: (2022)
par: Kang, Wonjune, et autres
Publié: (2022)
Documents similaires
-
BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications
par: Guimarães, Heitor R., et autres
Publié: (2026) -
AUDDT: Audio Unified Deepfake Detection Benchmark Toolkit
par: Zhu, Yi, et autres
Publié: (2025) -
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025) -
End-to-End Multi-Task Learning for Adjustable Joint Noise Reduction and Hearing Loss Compensation
par: Gonzalez, Philippe, et autres
Publié: (2026) -
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
par: Guimarães, Heitor R., et autres
Publié: (2025)