Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
Fuente:
arXiv
Guardado en:
| Autores principales: | Chowdhury, MD. Sagor, Chowdhury, Adiba Fairooz |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech
por: Chowdhury, Aurchi, et al.
Publicado: (2026)
por: Chowdhury, Aurchi, et al.
Publicado: (2026)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
BlasBench: An Open Benchmark for Irish Speech Recognition
por: Raj, Jyoutir, et al.
Publicado: (2026)
por: Raj, Jyoutir, et al.
Publicado: (2026)
Measuring the Accuracy of Automatic Speech Recognition Solutions
por: Kuhn, Korbinian, et al.
Publicado: (2024)
por: Kuhn, Korbinian, et al.
Publicado: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
por: Ahn, Taekyung, et al.
Publicado: (2024)
por: Ahn, Taekyung, et al.
Publicado: (2024)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
por: Halpern, Bence Mark, et al.
Publicado: (2026)
por: Halpern, Bence Mark, et al.
Publicado: (2026)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
por: Sharma, Manali, et al.
Publicado: (2026)
por: Sharma, Manali, et al.
Publicado: (2026)
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
por: Chien, Sheng-You, et al.
Publicado: (2026)
por: Chien, Sheng-You, et al.
Publicado: (2026)
Iterative Feature Boosting for Explainable Speech Emotion Recognition
por: Nfissi, Alaa, et al.
Publicado: (2024)
por: Nfissi, Alaa, et al.
Publicado: (2024)
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
por: Lin, Ye Bhone, et al.
Publicado: (2025)
por: Lin, Ye Bhone, et al.
Publicado: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
por: Marie, Ambre, et al.
Publicado: (2025)
por: Marie, Ambre, et al.
Publicado: (2025)
Everyday Speech in the Indian Subcontinent
por: P, Utkarsh
Publicado: (2024)
por: P, Utkarsh
Publicado: (2024)
Synthetic Voice Data for Automatic Speech Recognition in African Languages
por: DeRenzi, Brian, et al.
Publicado: (2025)
por: DeRenzi, Brian, et al.
Publicado: (2025)
Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition
por: Nfissi, Alaa, et al.
Publicado: (2024)
por: Nfissi, Alaa, et al.
Publicado: (2024)
SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models
por: Dua, Karan, et al.
Publicado: (2025)
por: Dua, Karan, et al.
Publicado: (2025)
Framework for Curating Speech Datasets and Evaluating ASR Systems: A Case Study for Polish
por: Junczyk, Michał
Publicado: (2024)
por: Junczyk, Michał
Publicado: (2024)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
por: Robertson, Sean, et al.
Publicado: (2023)
por: Robertson, Sean, et al.
Publicado: (2023)
A Sociolinguistic Analysis of Automatic Speech Recognition Bias in Newcastle English
por: Serditova, Dana, et al.
Publicado: (2026)
por: Serditova, Dana, et al.
Publicado: (2026)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
por: Soni, Aniket Abhishek
Publicado: (2025)
por: Soni, Aniket Abhishek
Publicado: (2025)
Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation
por: Merrill, Scott, et al.
Publicado: (2025)
por: Merrill, Scott, et al.
Publicado: (2025)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
por: Bhadra, Dipayan, et al.
Publicado: (2025)
por: Bhadra, Dipayan, et al.
Publicado: (2025)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
por: Kuhn, Korbinian, et al.
Publicado: (2025)
por: Kuhn, Korbinian, et al.
Publicado: (2025)
From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge
por: Chowdhury, Nafis, et al.
Publicado: (2025)
por: Chowdhury, Nafis, et al.
Publicado: (2025)
Diffuse or Confuse: A Diffusion Deepfake Speech Dataset
por: Firc, Anton, et al.
Publicado: (2024)
por: Firc, Anton, et al.
Publicado: (2024)
Dealing with Annotator Disagreement in Hate Speech Classification
por: Dehghan, Somaiyeh, et al.
Publicado: (2025)
por: Dehghan, Somaiyeh, et al.
Publicado: (2025)
The formation of perceptual space in early phonetic acquisition: a cross-linguistic modeling approach
por: Tan, Frank Lihui, et al.
Publicado: (2024)
por: Tan, Frank Lihui, et al.
Publicado: (2024)
Distilling Knowledge from Large Language Models: A Concept Bottleneck Model for Hate and Counter Speech Recognition
por: Labadie-Tamayo, Roberto, et al.
Publicado: (2025)
por: Labadie-Tamayo, Roberto, et al.
Publicado: (2025)
SITA: Learning Speaker-Invariant and Tone-Aware Speech Representations for Low-Resource Tonal Languages
por: Xu, Tianyi, et al.
Publicado: (2026)
por: Xu, Tianyi, et al.
Publicado: (2026)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
por: Alamr, Meshal, et al.
Publicado: (2026)
por: Alamr, Meshal, et al.
Publicado: (2026)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
por: Viswanathan, Janaki, et al.
Publicado: (2025)
por: Viswanathan, Janaki, et al.
Publicado: (2025)
CUPE: Contextless Universal Phoneme Encoder for Language-Agnostic Speech Processing
por: Rehman, Abdul, et al.
Publicado: (2025)
por: Rehman, Abdul, et al.
Publicado: (2025)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
por: Hori, Takaaki, et al.
Publicado: (2025)
por: Hori, Takaaki, et al.
Publicado: (2025)
Syllable based DNN-HMM Cantonese Speech to Text System
por: Wong, Timothy, et al.
Publicado: (2024)
por: Wong, Timothy, et al.
Publicado: (2024)
WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
por: Ali, Zien Sheikh, et al.
Publicado: (2026)
por: Ali, Zien Sheikh, et al.
Publicado: (2026)
Domain-Incremental Continual Learning for Robust and Efficient Keyword Spotting in Resource Constrained Systems
por: Dhungana, Prakash, et al.
Publicado: (2026)
por: Dhungana, Prakash, et al.
Publicado: (2026)
Improving French Synthetic Speech Quality via SSML Prosody Control
por: Ouali, Nassima Ould, et al.
Publicado: (2025)
por: Ouali, Nassima Ould, et al.
Publicado: (2025)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
Ejemplares similares
-
WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech
por: Chowdhury, Aurchi, et al.
Publicado: (2026) -
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
por: Wang, Hsuan-Yu, et al.
Publicado: (2025) -
BlasBench: An Open Benchmark for Irish Speech Recognition
por: Raj, Jyoutir, et al.
Publicado: (2026) -
Measuring the Accuracy of Automatic Speech Recognition Solutions
por: Kuhn, Korbinian, et al.
Publicado: (2024) -
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
por: Ahn, Taekyung, et al.
Publicado: (2024)