Guardado en:
| Autores principales: | Fang, Zhihua, He, Liang, Jiang, Weiwu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.01905 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Geolocation-Aware Robust Spoken Language Identification
por: Wang, Qingzheng, et al.
Publicado: (2025)
por: Wang, Qingzheng, et al.
Publicado: (2025)
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
por: Huang, Shun, et al.
Publicado: (2025)
por: Huang, Shun, et al.
Publicado: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
por: Nie, Yuting, et al.
Publicado: (2022)
por: Nie, Yuting, et al.
Publicado: (2022)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
por: Valente, Martina, et al.
Publicado: (2024)
por: Valente, Martina, et al.
Publicado: (2024)
A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction
por: Wang, Qing, et al.
Publicado: (2026)
por: Wang, Qing, et al.
Publicado: (2026)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker Verification
por: Fang, Zhihua, et al.
Publicado: (2026)
por: Fang, Zhihua, et al.
Publicado: (2026)
On The Landscape of Spoken Language Models: A Comprehensive Survey
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Spirit LM: Interleaved Spoken and Written Language Model
por: Nguyen, Tu Anh, et al.
Publicado: (2024)
por: Nguyen, Tu Anh, et al.
Publicado: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
por: Huang, Zhijie, et al.
Publicado: (2026)
por: Huang, Zhijie, et al.
Publicado: (2026)
On the Cross-lingual Transferability of Pre-trained wav2vec2-based Models
por: Grosman, Jonatas, et al.
Publicado: (2025)
por: Grosman, Jonatas, et al.
Publicado: (2025)
GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model
por: Gao, Yingying, et al.
Publicado: (2024)
por: Gao, Yingying, et al.
Publicado: (2024)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
por: Abdullah, Badr M., et al.
Publicado: (2025)
por: Abdullah, Badr M., et al.
Publicado: (2025)
WavChat: A Survey of Spoken Dialogue Models
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
MOSS-TTSD: Text to Spoken Dialogue Generation
por: Zhang, Yuqian, et al.
Publicado: (2026)
por: Zhang, Yuqian, et al.
Publicado: (2026)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
Implicit Self-supervised Language Representation for Spoken Language Diarization
por: Mishra, Jagabandhu, et al.
Publicado: (2023)
por: Mishra, Jagabandhu, et al.
Publicado: (2023)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
por: Le, Trang, et al.
Publicado: (2024)
por: Le, Trang, et al.
Publicado: (2024)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
por: Lu, Haitian, et al.
Publicado: (2025)
por: Lu, Haitian, et al.
Publicado: (2025)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
por: Poli, Maxime, et al.
Publicado: (2024)
por: Poli, Maxime, et al.
Publicado: (2024)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
por: Gosai, Advait, et al.
Publicado: (2025)
por: Gosai, Advait, et al.
Publicado: (2025)
Spoken Conversational Agents with Large Language Models
por: Yang, Chao-Han Huck, et al.
Publicado: (2025)
por: Yang, Chao-Han Huck, et al.
Publicado: (2025)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
por: Chen, Hongjie, et al.
Publicado: (2025)
por: Chen, Hongjie, et al.
Publicado: (2025)
BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
por: Shon, Suwon, et al.
Publicado: (2024)
por: Shon, Suwon, et al.
Publicado: (2024)
SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision
por: Poli, Maxime, et al.
Publicado: (2025)
por: Poli, Maxime, et al.
Publicado: (2025)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
por: Rutowski, Tomek, et al.
Publicado: (2024)
por: Rutowski, Tomek, et al.
Publicado: (2024)
Spoken Language Intelligence of Large Language Models for Language Learning
por: Peng, Linkai, et al.
Publicado: (2023)
por: Peng, Linkai, et al.
Publicado: (2023)
Ejemplares similares
-
Geolocation-Aware Robust Spoken Language Identification
por: Wang, Qingzheng, et al.
Publicado: (2025) -
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
por: Huang, Shun, et al.
Publicado: (2025) -
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026) -
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
por: Nie, Yuting, et al.
Publicado: (2022) -
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
por: Zhu, Yongxin, et al.
Publicado: (2024)