Advancing Topic Segmentation of Broadcasted Speech with Multilingual Semantic Embeddings
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shukla, Sakshi Deo, Denisov, Pavel, Turan, Tugtekin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
von: Denisov, Pavel, et al.
Veröffentlicht: (2024)
von: Denisov, Pavel, et al.
Veröffentlicht: (2024)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
von: Valente, Martina, et al.
Veröffentlicht: (2024)
von: Valente, Martina, et al.
Veröffentlicht: (2024)
SpeechTaxi: On Multilingual Semantic Speech Classification
von: Keller, Lennart, et al.
Veröffentlicht: (2024)
von: Keller, Lennart, et al.
Veröffentlicht: (2024)
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
von: Yang, Zhengdong, et al.
Veröffentlicht: (2025)
von: Yang, Zhengdong, et al.
Veröffentlicht: (2025)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
von: Lee, Beomseok, et al.
Veröffentlicht: (2024)
von: Lee, Beomseok, et al.
Veröffentlicht: (2024)
Advancing Airport Tower Command Recognition: Integrating Squeeze-and-Excitation and Broadcasted Residual Learning
von: Lin, Yuanxi, et al.
Veröffentlicht: (2024)
von: Lin, Yuanxi, et al.
Veröffentlicht: (2024)
Configurable Multilingual ASR with Speech Summary Representations
von: Zhu, Harrison, et al.
Veröffentlicht: (2024)
von: Zhu, Harrison, et al.
Veröffentlicht: (2024)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
von: Elisha, Shahar, et al.
Veröffentlicht: (2024)
von: Elisha, Shahar, et al.
Veröffentlicht: (2024)
CAMEO: Collection of Multilingual Emotional Speech Corpora
von: Christop, Iwona, et al.
Veröffentlicht: (2025)
von: Christop, Iwona, et al.
Veröffentlicht: (2025)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
von: Shi, Jiatong, et al.
Veröffentlicht: (2023)
von: Shi, Jiatong, et al.
Veröffentlicht: (2023)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
von: Adila, Aulia, et al.
Veröffentlicht: (2024)
von: Adila, Aulia, et al.
Veröffentlicht: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2025)
von: Zheng, Zhisheng, et al.
Veröffentlicht: (2025)
Causally Disentangled Contrastive Learning for Multilingual Speaker Embeddings
von: Olijslager, Mariëtte, et al.
Veröffentlicht: (2026)
von: Olijslager, Mariëtte, et al.
Veröffentlicht: (2026)
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
von: Xuan, Xi, et al.
Veröffentlicht: (2025)
von: Xuan, Xi, et al.
Veröffentlicht: (2025)
Multilingual Stutter Event Detection for English, German, and Mandarin Speech
von: Haas, Felix, et al.
Veröffentlicht: (2026)
von: Haas, Felix, et al.
Veröffentlicht: (2026)
XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model
von: Casanova, Edresson, et al.
Veröffentlicht: (2024)
von: Casanova, Edresson, et al.
Veröffentlicht: (2024)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
von: Piñeiro-Martín, Andrés, et al.
Veröffentlicht: (2024)
von: Piñeiro-Martín, Andrés, et al.
Veröffentlicht: (2024)
Generalized Multilingual Text-to-Speech Generation with Language-Aware Style Adaptation
von: Lou, Haowei, et al.
Veröffentlicht: (2025)
von: Lou, Haowei, et al.
Veröffentlicht: (2025)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
von: Shao, Hang, et al.
Veröffentlicht: (2023)
von: Shao, Hang, et al.
Veröffentlicht: (2023)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
von: Shao, Qijie, et al.
Veröffentlicht: (2025)
von: Shao, Qijie, et al.
Veröffentlicht: (2025)
CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset
von: Yan, Brian, et al.
Veröffentlicht: (2025)
von: Yan, Brian, et al.
Veröffentlicht: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
BoSS: Beyond-Semantic Speech
von: Wang, Qing, et al.
Veröffentlicht: (2025)
von: Wang, Qing, et al.
Veröffentlicht: (2025)
PSST! Prosodic Speech Segmentation with Transformers
von: Roll, Nathan, et al.
Veröffentlicht: (2023)
von: Roll, Nathan, et al.
Veröffentlicht: (2023)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
von: Le-Duc, Khai, et al.
Veröffentlicht: (2024)
von: Le-Duc, Khai, et al.
Veröffentlicht: (2024)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
von: Bijoy, Mehedi Hasan, et al.
Veröffentlicht: (2025)
von: Bijoy, Mehedi Hasan, et al.
Veröffentlicht: (2025)
Novel Parasitic Dual-Scale Modeling for Efficient and Accurate Multilingual Speech Translation
von: Le, Chenyang, et al.
Veröffentlicht: (2025)
von: Le, Chenyang, et al.
Veröffentlicht: (2025)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
von: He, Haorui, et al.
Veröffentlicht: (2025)
von: He, Haorui, et al.
Veröffentlicht: (2025)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
von: Xue, Hongfei, et al.
Veröffentlicht: (2023)
von: Xue, Hongfei, et al.
Veröffentlicht: (2023)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
von: Li, Zhu, et al.
Veröffentlicht: (2025)
von: Li, Zhu, et al.
Veröffentlicht: (2025)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
von: Kando, Shunsuke, et al.
Veröffentlicht: (2025)
von: Kando, Shunsuke, et al.
Veröffentlicht: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
von: Sun, Chunyu, et al.
Veröffentlicht: (2025)
von: Sun, Chunyu, et al.
Veröffentlicht: (2025)
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
von: Yeo, Eunjung
Veröffentlicht: (2024)
von: Yeo, Eunjung
Veröffentlicht: (2024)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
von: Yen, Hao, et al.
Veröffentlicht: (2024)
von: Yen, Hao, et al.
Veröffentlicht: (2024)
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
von: Yusuyin, Saierdaer, et al.
Veröffentlicht: (2024)
von: Yusuyin, Saierdaer, et al.
Veröffentlicht: (2024)
Advancing Speech Translation: A Corpus of Mandarin-English Conversational Telephone Speech
von: Wotherspoon, Shannon, et al.
Veröffentlicht: (2024)
von: Wotherspoon, Shannon, et al.
Veröffentlicht: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2024)
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2024)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
von: Kashiwagi, Yosuke, et al.
Veröffentlicht: (2024)
von: Kashiwagi, Yosuke, et al.
Veröffentlicht: (2024)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
von: Nguyen, Tuan, et al.
Veröffentlicht: (2025)
von: Nguyen, Tuan, et al.
Veröffentlicht: (2025)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
von: Wang, Haoyu, et al.
Veröffentlicht: (2022)
von: Wang, Haoyu, et al.
Veröffentlicht: (2022)
Ähnliche Einträge
-
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
von: Denisov, Pavel, et al.
Veröffentlicht: (2024) -
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
von: Valente, Martina, et al.
Veröffentlicht: (2024) -
SpeechTaxi: On Multilingual Semantic Speech Classification
von: Keller, Lennart, et al.
Veröffentlicht: (2024) -
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
von: Yang, Zhengdong, et al.
Veröffentlicht: (2025) -
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
von: Lee, Beomseok, et al.
Veröffentlicht: (2024)