SyllableLM: Learning Coarse Semantic Units for Speech Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Baade, Alan, Peng, Puyuan, Harwath, David |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BAT: Learning to Reason about Spatial Sounds with Large Language Models
por: Zheng, Zhisheng, et al.
Publicado: (2024)
por: Zheng, Zhisheng, et al.
Publicado: (2024)
Unifying Model and Layer Fusion for Speech Foundation Models
por: Shih, Yi-Jen, et al.
Publicado: (2025)
por: Shih, Yi-Jen, et al.
Publicado: (2025)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
por: Peng, Puyuan, et al.
Publicado: (2024)
por: Peng, Puyuan, et al.
Publicado: (2024)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
por: Diwan, Anuj, et al.
Publicado: (2026)
por: Diwan, Anuj, et al.
Publicado: (2026)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
por: Shih, Yi-Jen, et al.
Publicado: (2024)
por: Shih, Yi-Jen, et al.
Publicado: (2024)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
por: Gong, Hongyu, et al.
Publicado: (2024)
por: Gong, Hongyu, et al.
Publicado: (2024)
Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
An Empirical Analysis of Discrete Unit Representations in Speech Language Modeling Pre-training
por: Labrak, Yanis, et al.
Publicado: (2025)
por: Labrak, Yanis, et al.
Publicado: (2025)
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
por: Song, Yakun, et al.
Publicado: (2024)
por: Song, Yakun, et al.
Publicado: (2024)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
por: Zheng, Zhisheng, et al.
Publicado: (2025)
por: Zheng, Zhisheng, et al.
Publicado: (2025)
Scaling Rich Style-Prompted Text-to-Speech Datasets
por: Diwan, Anuj, et al.
Publicado: (2025)
por: Diwan, Anuj, et al.
Publicado: (2025)
Interface Design for Self-Supervised Speech Models
por: Shih, Yi-Jen, et al.
Publicado: (2024)
por: Shih, Yi-Jen, et al.
Publicado: (2024)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
por: Hsu, Ming-Hao, et al.
Publicado: (2023)
por: Hsu, Ming-Hao, et al.
Publicado: (2023)
Textless Speech-to-Speech Translation With Limited Parallel Data
por: Diwan, Anuj, et al.
Publicado: (2023)
por: Diwan, Anuj, et al.
Publicado: (2023)
Integrating Self-supervised Speech Model with Pseudo Word-level Targets from Visually-grounded Speech Model
por: Fang, Hung-Chieh, et al.
Publicado: (2024)
por: Fang, Hung-Chieh, et al.
Publicado: (2024)
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
por: Yang, Guanrou, et al.
Publicado: (2026)
por: Yang, Guanrou, et al.
Publicado: (2026)
Entropy-based Coarse and Compressed Semantic Speech Representation Learning
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Phonology-Guided Speech-to-Speech Translation for African Languages
por: Ochieng, Peter, et al.
Publicado: (2024)
por: Ochieng, Peter, et al.
Publicado: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
por: Huang, Wei-Ping, et al.
Publicado: (2025)
por: Huang, Wei-Ping, et al.
Publicado: (2025)
SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data
por: Wang, Hsuan-Fu, et al.
Publicado: (2024)
por: Wang, Hsuan-Fu, et al.
Publicado: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
por: Chen, William, et al.
Publicado: (2024)
por: Chen, William, et al.
Publicado: (2024)
Pretraining Large Brain Language Model for Active BCI: Silent Speech
por: Zhou, Jinzhao, et al.
Publicado: (2025)
por: Zhou, Jinzhao, et al.
Publicado: (2025)
Sylber 2.0: A Universal Syllable Embedding
por: Cho, Cheol Jun, et al.
Publicado: (2026)
por: Cho, Cheol Jun, et al.
Publicado: (2026)
Adapting Foundation Speech Recognition Models to Impaired Speech: A Semantic Re-chaining Approach for Personalization of German Speech
por: Pokel, Niclas, et al.
Publicado: (2025)
por: Pokel, Niclas, et al.
Publicado: (2025)
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
por: Lu, Yichen, et al.
Publicado: (2024)
por: Lu, Yichen, et al.
Publicado: (2024)
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
por: Moure, Pehuén, et al.
Publicado: (2026)
por: Moure, Pehuén, et al.
Publicado: (2026)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2025)
por: Yao, Wenhan, et al.
Publicado: (2025)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling
por: Visser, Nicol, et al.
Publicado: (2026)
por: Visser, Nicol, et al.
Publicado: (2026)
MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond
por: Huzaifah, Muhammad, et al.
Publicado: (2024)
por: Huzaifah, Muhammad, et al.
Publicado: (2024)
Linear-Complexity Self-Supervised Learning for Speech Processing
por: Zhang, Shucong, et al.
Publicado: (2024)
por: Zhang, Shucong, et al.
Publicado: (2024)
Dual Information Speech Language Models for Emotional Conversations
por: Wang, Chun, et al.
Publicado: (2025)
por: Wang, Chun, et al.
Publicado: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
por: Diack, Abdoulaye, et al.
Publicado: (2026)
por: Diack, Abdoulaye, et al.
Publicado: (2026)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
por: Zhang, He, et al.
Publicado: (2025)
por: Zhang, He, et al.
Publicado: (2025)
A Preliminary Analysis of Automatic Word and Syllable Prominence Detection in Non-Native Speech With Text-to-Speech Prosody Embeddings
por: Mondal, Anindita, et al.
Publicado: (2024)
por: Mondal, Anindita, et al.
Publicado: (2024)
Ejemplares similares
-
BAT: Learning to Reason about Spatial Sounds with Large Language Models
por: Zheng, Zhisheng, et al.
Publicado: (2024) -
Unifying Model and Layer Fusion for Speech Foundation Models
por: Shih, Yi-Jen, et al.
Publicado: (2025) -
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
por: Peng, Puyuan, et al.
Publicado: (2024) -
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
por: Diwan, Anuj, et al.
Publicado: (2026) -
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)