A Holistic Framework for Robust Bangla ASR and Speaker Diarization with Optimized VAD and CTC Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Ishmam, Zarif, Mahir, Zarif, Wasif, Shafnan, Moin, Md. Ishtiak |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robust Target Speaker Diarization and Separation via Augmented Speaker Embedding Sampling
di: Jalal, Md Asif, et al.
Pubblicazione: (2025)
di: Jalal, Md Asif, et al.
Pubblicazione: (2025)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026)
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026)
Exploring Speaker Diarization with Mixture of Experts
di: Yang, Gaobin, et al.
Pubblicazione: (2025)
di: Yang, Gaobin, et al.
Pubblicazione: (2025)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2026)
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2026)
An Investigation Into Various Approaches For Bengali Long-Form Speech Transcription and Bengali Speaker Diarization
di: Jahan, Epshita, et al.
Pubblicazione: (2026)
di: Jahan, Epshita, et al.
Pubblicazione: (2026)
Probabilistic Fusion and Calibration of Neural Speaker Diarization Models
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2025)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2025)
SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)
di: Landini, Federico
Pubblicazione: (2024)
SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
di: Pacheco, Eduardo, et al.
Pubblicazione: (2025)
di: Pacheco, Eduardo, et al.
Pubblicazione: (2025)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
di: Mariotte, Theo, et al.
Pubblicazione: (2024)
di: Mariotte, Theo, et al.
Pubblicazione: (2024)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
di: Palzer, David, et al.
Pubblicazione: (2025)
di: Palzer, David, et al.
Pubblicazione: (2025)
Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track
di: Huang, Jiawen, et al.
Pubblicazione: (2026)
di: Huang, Jiawen, et al.
Pubblicazione: (2026)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
di: Liu, Hanwen, et al.
Pubblicazione: (2026)
di: Liu, Hanwen, et al.
Pubblicazione: (2026)
Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization
di: Marie, Ambre, et al.
Pubblicazione: (2026)
di: Marie, Ambre, et al.
Pubblicazione: (2026)
A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
di: Huang, Jia-Hong, et al.
Pubblicazione: (2026)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2026)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
di: Chowdhury, MD. Sagor, et al.
Pubblicazione: (2026)
di: Chowdhury, MD. Sagor, et al.
Pubblicazione: (2026)
Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper
di: Islam, Akif, et al.
Pubblicazione: (2026)
di: Islam, Akif, et al.
Pubblicazione: (2026)
MOSS Transcribe Diarize Technical Report
di: AI, MOSI., et al.
Pubblicazione: (2026)
di: AI, MOSI., et al.
Pubblicazione: (2026)
TinyML for Speech Recognition
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
Enhancing CTC-based speech recognition with diverse modeling units
di: Han, Shiyi, et al.
Pubblicazione: (2024)
di: Han, Shiyi, et al.
Pubblicazione: (2024)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
Continual Speaker Identity Unlearning with Minimal Interference
di: Kim, Jinju, et al.
Pubblicazione: (2026)
di: Kim, Jinju, et al.
Pubblicazione: (2026)
ASR-Synchronized Speaker-Role Diarization
di: Ghosh, Arindam, et al.
Pubblicazione: (2025)
di: Ghosh, Arindam, et al.
Pubblicazione: (2025)
Assessing the Robustness of Spectral Clustering for Deep Speaker Diarization
di: Raghav, Nikhil, et al.
Pubblicazione: (2024)
di: Raghav, Nikhil, et al.
Pubblicazione: (2024)
Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation
di: Thebaud, Thomas, et al.
Pubblicazione: (2026)
di: Thebaud, Thomas, et al.
Pubblicazione: (2026)
Evaluating Identity Leakage in Speaker De-Identification Systems
di: Seo, Seungmin, et al.
Pubblicazione: (2025)
di: Seo, Seungmin, et al.
Pubblicazione: (2025)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
di: Fang, Linghan, et al.
Pubblicazione: (2026)
di: Fang, Linghan, et al.
Pubblicazione: (2026)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Robust Target Speaker Diarization and Separation via Augmented Speaker Embedding Sampling
di: Jalal, Md Asif, et al.
Pubblicazione: (2025) -
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026) -
Exploring Speaker Diarization with Mixture of Experts
di: Yang, Gaobin, et al.
Pubblicazione: (2025) -
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2026) -
An Investigation Into Various Approaches For Bengali Long-Form Speech Transcription and Bengali Speaker Diarization
di: Jahan, Epshita, et al.
Pubblicazione: (2026)