Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Valente, Martina, Brugnara, Fabio, Morrone, Giovanni, Zovato, Enrico, Badino, Leonardo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
di: Morrone, Giovanni, et al.
Pubblicazione: (2023)
di: Morrone, Giovanni, et al.
Pubblicazione: (2023)
Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling
di: Poncelet, Jakob, et al.
Pubblicazione: (2025)
di: Poncelet, Jakob, et al.
Pubblicazione: (2025)
On the use of Performer and Agent Attention for Spoken Language Identification
di: dhiman, Jitendra Kumar, et al.
Pubblicazione: (2025)
di: dhiman, Jitendra Kumar, et al.
Pubblicazione: (2025)
Advancing Topic Segmentation of Broadcasted Speech with Multilingual Semantic Embeddings
di: Shukla, Sakshi Deo, et al.
Pubblicazione: (2024)
di: Shukla, Sakshi Deo, et al.
Pubblicazione: (2024)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
di: Wang, Shih-heng, et al.
Pubblicazione: (2024)
di: Wang, Shih-heng, et al.
Pubblicazione: (2024)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
di: Li, Mohan, et al.
Pubblicazione: (2024)
di: Li, Mohan, et al.
Pubblicazione: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
di: Huang, Jiawen, et al.
Pubblicazione: (2024)
di: Huang, Jiawen, et al.
Pubblicazione: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
Prompting Whisper for Joint Speech Transcription and Diarization
di: Zamyrova, Mariia, et al.
Pubblicazione: (2026)
di: Zamyrova, Mariia, et al.
Pubblicazione: (2026)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
di: Zheng, Xiuwen, et al.
Pubblicazione: (2024)
di: Zheng, Xiuwen, et al.
Pubblicazione: (2024)
Exploiting Music Source Separation for Automatic Lyrics Transcription with Whisper
di: Syed, Jaza, et al.
Pubblicazione: (2025)
di: Syed, Jaza, et al.
Pubblicazione: (2025)
Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
Enhanced Automatic Drum Transcription via Drum Stem Source Separation
di: Riley, Xavier, et al.
Pubblicazione: (2025)
di: Riley, Xavier, et al.
Pubblicazione: (2025)
Score-Informed Transformer for Refining MIDI Velocity in Automatic Music Transcription
di: He, Zhanhong, et al.
Pubblicazione: (2025)
di: He, Zhanhong, et al.
Pubblicazione: (2025)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024)
di: Park, Se Jin, et al.
Pubblicazione: (2024)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
Fotheidil: an Automatic Transcription System for the Irish Language
di: Lonergan, Liam, et al.
Pubblicazione: (2024)
di: Lonergan, Liam, et al.
Pubblicazione: (2024)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
di: Tian, Jingguang, et al.
Pubblicazione: (2024)
di: Tian, Jingguang, et al.
Pubblicazione: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
di: Zhou, Yixuan, et al.
Pubblicazione: (2024)
di: Zhou, Yixuan, et al.
Pubblicazione: (2024)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
di: Adila, Aulia, et al.
Pubblicazione: (2024)
di: Adila, Aulia, et al.
Pubblicazione: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)
di: Cooper, Erica, et al.
Pubblicazione: (2025)
Exploring Procedural Data Generation for Automatic Acoustic Guitar Fingerpicking Transcription
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022)
di: Nie, Yuting, et al.
Pubblicazione: (2022)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
Documenti analoghi
-
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024) -
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
di: Morrone, Giovanni, et al.
Pubblicazione: (2023) -
Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling
di: Poncelet, Jakob, et al.
Pubblicazione: (2025) -
On the use of Performer and Agent Attention for Spoken Language Identification
di: dhiman, Jitendra Kumar, et al.
Pubblicazione: (2025) -
Advancing Topic Segmentation of Broadcasted Speech with Multilingual Semantic Embeddings
di: Shukla, Sakshi Deo, et al.
Pubblicazione: (2024)