BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Samin, Md. Nazmus Sadat, Ahad, Jawad Ibn, Medha, Tanjila Ahmed, Rahman, Fuad, Amin, Mohammad Ruhul, Mohammed, Nabeel, Rahman, Shafin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dynamic Temperature Scheduler for Knowledge Distillation
par: Islam, Sibgat Ul, et autres
Publié: (2025)
par: Islam, Sibgat Ul, et autres
Publié: (2025)
Empowering Meta-Analysis: Leveraging Large Language Models for Scientific Synthesis
par: Ahad, Jawad Ibn, et autres
Publié: (2024)
par: Ahad, Jawad Ibn, et autres
Publié: (2024)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
par: Kabir, Muhammad Rafsan, et autres
Publié: (2024)
par: Kabir, Muhammad Rafsan, et autres
Publié: (2024)
LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models
par: Ahad, Jawad Ibn, et autres
Publié: (2025)
par: Ahad, Jawad Ibn, et autres
Publié: (2025)
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2026)
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2026)
Beyond Real Weights: Hypercomplex Representations for Stable Quantization
par: Ahad, Jawad Ibn, et autres
Publié: (2025)
par: Ahad, Jawad Ibn, et autres
Publié: (2025)
LegalRAG: A Hybrid RAG System for Multilingual Legal Information Retrieval
par: Kabir, Muhammad Rafsan, et autres
Publié: (2025)
par: Kabir, Muhammad Rafsan, et autres
Publié: (2025)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2025)
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2025)
End-to-End Speech Recognition with Pre-trained Masked Language Model
par: Higuchi, Yosuke, et autres
Publié: (2024)
par: Higuchi, Yosuke, et autres
Publié: (2024)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
par: Jing, Kangqi, et autres
Publié: (2025)
par: Jing, Kangqi, et autres
Publié: (2025)
Using Adapters to Overcome Catastrophic Forgetting in End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2022)
par: Eeckt, Steven Vander, et autres
Publié: (2022)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
par: Bhuiyan, Mohammed Aman, et autres
Publié: (2026)
par: Bhuiyan, Mohammed Aman, et autres
Publié: (2026)
Teacher-Guided One-Shot Pruning via Context-Aware Knowledge Distillation
par: Alim, Md. Samiul, et autres
Publié: (2025)
par: Alim, Md. Samiul, et autres
Publié: (2025)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
par: Higuchi, Yosuke, et autres
Publié: (2023)
par: Higuchi, Yosuke, et autres
Publié: (2023)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
par: Kong, Xiangzhu, et autres
Publié: (2025)
par: Kong, Xiangzhu, et autres
Publié: (2025)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
par: Ahmad, Hawraz A., et autres
Publié: (2024)
par: Ahmad, Hawraz A., et autres
Publié: (2024)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
par: Dai, Wang, et autres
Publié: (2024)
par: Dai, Wang, et autres
Publié: (2024)
Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription
par: Dai, Yuhang, et autres
Publié: (2026)
par: Dai, Yuhang, et autres
Publié: (2026)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
par: Chen, Junyang, et autres
Publié: (2026)
par: Chen, Junyang, et autres
Publié: (2026)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations
par: Kong, Xiangzhu, et autres
Publié: (2024)
par: Kong, Xiangzhu, et autres
Publié: (2024)
Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs
par: Hsu, Ming-Hao, et autres
Publié: (2026)
par: Hsu, Ming-Hao, et autres
Publié: (2026)
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech
par: Mohammad, Mir Sayeed, et autres
Publié: (2024)
par: Mohammad, Mir Sayeed, et autres
Publié: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
par: Raimon, Athul, et autres
Publié: (2024)
par: Raimon, Athul, et autres
Publié: (2024)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
Continual Learning for Monolingual End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2021)
par: Eeckt, Steven Vander, et autres
Publié: (2021)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
par: Guimarães, Heitor R., et autres
Publié: (2024)
par: Guimarães, Heitor R., et autres
Publié: (2024)
Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization
par: You, Jian, et autres
Publié: (2025)
par: You, Jian, et autres
Publié: (2025)
Documents similaires
-
Dynamic Temperature Scheduler for Knowledge Distillation
par: Islam, Sibgat Ul, et autres
Publié: (2025) -
Empowering Meta-Analysis: Leveraging Large Language Models for Scientific Synthesis
par: Ahad, Jawad Ibn, et autres
Publié: (2024) -
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
par: Kabir, Muhammad Rafsan, et autres
Publié: (2024) -
LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models
par: Ahad, Jawad Ibn, et autres
Publié: (2025) -
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2026)