Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Chou, Ju-Chieh, Zhou, Jiawei, Livescu, Karen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
by: Chou, Ju-Chieh, et al.
Published: (2023)
by: Chou, Ju-Chieh, et al.
Published: (2023)
Chunk-Distilled Language Modeling
by: Li, Yanhong, et al.
Published: (2024)
by: Li, Yanhong, et al.
Published: (2024)
Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models
by: Ògúnrèmí, Tolúlopé, et al.
Published: (2025)
by: Ògúnrèmí, Tolúlopé, et al.
Published: (2025)
GmSLM : Generative Marmoset Spoken Language Modeling
by: Sternberg, Talia, et al.
Published: (2025)
by: Sternberg, Talia, et al.
Published: (2025)
On the Predictive Power of Representation Dispersion in Language Models
by: Li, Yanhong, et al.
Published: (2025)
by: Li, Yanhong, et al.
Published: (2025)
Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs
by: Karabüklü, Serpil, et al.
Published: (2026)
by: Karabüklü, Serpil, et al.
Published: (2026)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
by: Lin, Guan-Ting, et al.
Published: (2024)
by: Lin, Guan-Ting, et al.
Published: (2024)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
by: Shon, Suwon, et al.
Published: (2024)
by: Shon, Suwon, et al.
Published: (2024)
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
by: Hsu, Chan-Jan, et al.
Published: (2026)
by: Hsu, Chan-Jan, et al.
Published: (2026)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
by: Chen, Hongjie, et al.
Published: (2025)
by: Chen, Hongjie, et al.
Published: (2025)
On The Landscape of Spoken Language Models: A Comprehensive Survey
by: Arora, Siddhant, et al.
Published: (2025)
by: Arora, Siddhant, et al.
Published: (2025)
JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems
by: Yang, Guangzhao, et al.
Published: (2026)
by: Yang, Guangzhao, et al.
Published: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
by: Arora, Siddhant, et al.
Published: (2024)
by: Arora, Siddhant, et al.
Published: (2024)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
by: Arora, Siddhant, et al.
Published: (2023)
by: Arora, Siddhant, et al.
Published: (2023)
VoiceBBQ: Investigating Effect of Content and Acoustics in Social Bias of Spoken Language Model
by: Choi, Junhyuk, et al.
Published: (2025)
by: Choi, Junhyuk, et al.
Published: (2025)
SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision
by: Poli, Maxime, et al.
Published: (2025)
by: Poli, Maxime, et al.
Published: (2025)
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
by: Li, Guojian, et al.
Published: (2025)
by: Li, Guojian, et al.
Published: (2025)
Cross-Modal Taxonomic Generalization in (Vision-) Language Models
by: Xu, Tianyang, et al.
Published: (2026)
by: Xu, Tianyang, et al.
Published: (2026)
SLM-SQL: An Exploration of Small Language Models for Text-to-SQL
by: Sheng, Lei, et al.
Published: (2025)
by: Sheng, Lei, et al.
Published: (2025)
OKBench: Democratizing LLM Evaluation with Fully Automated, On-Demand, Open Knowledge Benchmarking
by: Li, Yanhong, et al.
Published: (2025)
by: Li, Yanhong, et al.
Published: (2025)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
by: Shakeel, Muhammad, et al.
Published: (2026)
by: Shakeel, Muhammad, et al.
Published: (2026)
SHuBERT: Self-Supervised Sign Language Representation Learning via Multi-Stream Cluster Prediction
by: Gueuwou, Shester, et al.
Published: (2024)
by: Gueuwou, Shester, et al.
Published: (2024)
Semi-Supervised Spoken Language Glossification
by: Yao, Huijie, et al.
Published: (2024)
by: Yao, Huijie, et al.
Published: (2024)
SLM-Mod: Small Language Models Surpass LLMs at Content Moderation
by: Zhan, Xianyang, et al.
Published: (2024)
by: Zhan, Xianyang, et al.
Published: (2024)
Structured Tree Alignment for Evaluation of (Speech) Constituency Parsing
by: Shi, Freda, et al.
Published: (2024)
by: Shi, Freda, et al.
Published: (2024)
Can LLM Agents Identify Spoken Dialects like a Linguist?
by: Bystrich, Tobias, et al.
Published: (2026)
by: Bystrich, Tobias, et al.
Published: (2026)
SignMusketeers: An Efficient Multi-Stream Approach for Sign Language Translation at Scale
by: Gueuwou, Shester, et al.
Published: (2024)
by: Gueuwou, Shester, et al.
Published: (2024)
SLM as Guardian: Pioneering AI Safety with Small Language Models
by: Kwon, Ohjoon, et al.
Published: (2024)
by: Kwon, Ohjoon, et al.
Published: (2024)
In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads
by: Pouw, Charlotte, et al.
Published: (2026)
by: Pouw, Charlotte, et al.
Published: (2026)
Joint Learning of Context and Feedback Embeddings in Spoken Dialogue
by: Qian, Livia, et al.
Published: (2024)
by: Qian, Livia, et al.
Published: (2024)
Linguistic Minimal Pairs Elicit Linguistic Similarity in Large Language Models
by: Zhou, Xinyu, et al.
Published: (2024)
by: Zhou, Xinyu, et al.
Published: (2024)
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
by: Chien, Chung-Ming, et al.
Published: (2026)
by: Chien, Chung-Ming, et al.
Published: (2026)
Advancing SLM Tool-Use Capability using Reinforcement Learning
by: Paprunia, Dhruvi, et al.
Published: (2025)
by: Paprunia, Dhruvi, et al.
Published: (2025)
What Do Self-Supervised Speech Models Know About Words?
by: Pasad, Ankita, et al.
Published: (2023)
by: Pasad, Ankita, et al.
Published: (2023)
Multi-Objective Linguistic Control of Large Language Models
by: Nguyen, Dang, et al.
Published: (2024)
by: Nguyen, Dang, et al.
Published: (2024)
SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version
by: Pham, Nghiem Thanh, et al.
Published: (2025)
by: Pham, Nghiem Thanh, et al.
Published: (2025)
Large Language Models for Expansion of Spoken Language Understanding Systems to New Languages
by: Hoscilowicz, Jakub, et al.
Published: (2024)
by: Hoscilowicz, Jakub, et al.
Published: (2024)
Enhancing Spoken Discourse Modeling in Language Models Using Gestural Cues
by: Suresh, Varsha, et al.
Published: (2025)
by: Suresh, Varsha, et al.
Published: (2025)
Hire a Linguist!: Learning Endangered Languages with In-Context Linguistic Descriptions
by: Zhang, Kexun, et al.
Published: (2024)
by: Zhang, Kexun, et al.
Published: (2024)
Kuwain 1.5B: An Arabic SLM via Language Injection
by: Hennara, Khalil, et al.
Published: (2025)
by: Hennara, Khalil, et al.
Published: (2025)
Similar Items
-
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
by: Chou, Ju-Chieh, et al.
Published: (2023) -
Chunk-Distilled Language Modeling
by: Li, Yanhong, et al.
Published: (2024) -
Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models
by: Ògúnrèmí, Tolúlopé, et al.
Published: (2025) -
GmSLM : Generative Marmoset Spoken Language Modeling
by: Sternberg, Talia, et al.
Published: (2025) -
On the Predictive Power of Representation Dispersion in Language Models
by: Li, Yanhong, et al.
Published: (2025)