Spoken Language Identification with Pre-trained Models and Margin Loss
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Zhihua, He, Liang, Jiang, Weiwu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Geolocation-Aware Robust Spoken Language Identification
di: Wang, Qingzheng, et al.
Pubblicazione: (2025)
di: Wang, Qingzheng, et al.
Pubblicazione: (2025)
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
di: Huang, Shun, et al.
Pubblicazione: (2025)
di: Huang, Shun, et al.
Pubblicazione: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022)
di: Nie, Yuting, et al.
Pubblicazione: (2022)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction
di: Wang, Qing, et al.
Pubblicazione: (2026)
di: Wang, Qing, et al.
Pubblicazione: (2026)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
di: Valente, Martina, et al.
Pubblicazione: (2024)
di: Valente, Martina, et al.
Pubblicazione: (2024)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
On the Cross-lingual Transferability of Pre-trained wav2vec2-based Models
di: Grosman, Jonatas, et al.
Pubblicazione: (2025)
di: Grosman, Jonatas, et al.
Pubblicazione: (2025)
On The Landscape of Spoken Language Models: A Comprehensive Survey
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Spirit LM: Interleaved Spoken and Written Language Model
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024)
di: Park, Se Jin, et al.
Pubblicazione: (2024)
Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker Verification
di: Fang, Zhihua, et al.
Pubblicazione: (2026)
di: Fang, Zhihua, et al.
Pubblicazione: (2026)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model
di: Gao, Yingying, et al.
Pubblicazione: (2024)
di: Gao, Yingying, et al.
Pubblicazione: (2024)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
MOSS-TTSD: Text to Spoken Dialogue Generation
di: Zhang, Yuqian, et al.
Pubblicazione: (2026)
di: Zhang, Yuqian, et al.
Pubblicazione: (2026)
Implicit Self-supervised Language Representation for Spoken Language Diarization
di: Mishra, Jagabandhu, et al.
Pubblicazione: (2023)
di: Mishra, Jagabandhu, et al.
Pubblicazione: (2023)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
di: Lu, Haitian, et al.
Pubblicazione: (2025)
di: Lu, Haitian, et al.
Pubblicazione: (2025)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
di: Le, Trang, et al.
Pubblicazione: (2024)
di: Le, Trang, et al.
Pubblicazione: (2024)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
di: Poli, Maxime, et al.
Pubblicazione: (2024)
di: Poli, Maxime, et al.
Pubblicazione: (2024)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
WavChat: A Survey of Spoken Dialogue Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
di: Arora, Siddhant, et al.
Pubblicazione: (2026)
di: Arora, Siddhant, et al.
Pubblicazione: (2026)
Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
di: Gosai, Advait, et al.
Pubblicazione: (2025)
di: Gosai, Advait, et al.
Pubblicazione: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
di: Shon, Suwon, et al.
Pubblicazione: (2024)
di: Shon, Suwon, et al.
Pubblicazione: (2024)
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision
di: Poli, Maxime, et al.
Pubblicazione: (2025)
di: Poli, Maxime, et al.
Pubblicazione: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
Leveraging Zipformer Model for Effective Language Identification in Code-Switched Child-Directed Speech
di: Shankar, Lavanya, et al.
Pubblicazione: (2025)
di: Shankar, Lavanya, et al.
Pubblicazione: (2025)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Geolocation-Aware Robust Spoken Language Identification
di: Wang, Qingzheng, et al.
Pubblicazione: (2025) -
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
di: Huang, Shun, et al.
Pubblicazione: (2025) -
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026) -
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022) -
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)