DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Shon, Suwon, Kim, Kwangyoun, Hsu, Yi-Te, Sridhar, Prashant, Watanabe, Shinji, Livescu, Karen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
di: Arora, Siddhant, et al.
Pubblicazione: (2023)
di: Arora, Siddhant, et al.
Pubblicazione: (2023)
Improving ASR Contextual Biasing with Guided Attention
di: Tang, Jiyang, et al.
Pubblicazione: (2024)
di: Tang, Jiyang, et al.
Pubblicazione: (2024)
On-device Streaming Discrete Speech Units
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models
di: Poncelet, Jakob, et al.
Pubblicazione: (2024)
di: Poncelet, Jakob, et al.
Pubblicazione: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
di: Wang, Shih-heng, et al.
Pubblicazione: (2024)
di: Wang, Shih-heng, et al.
Pubblicazione: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
di: Tao, Dehua, et al.
Pubblicazione: (2024)
di: Tao, Dehua, et al.
Pubblicazione: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Discrete Speech Unit Extraction via Independent Component Analysis
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
di: Li, Mohan, et al.
Pubblicazione: (2024)
di: Li, Mohan, et al.
Pubblicazione: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
di: Sheng, Zhichao, et al.
Pubblicazione: (2025)
di: Sheng, Zhichao, et al.
Pubblicazione: (2025)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
di: Chen, Peikun, et al.
Pubblicazione: (2024)
di: Chen, Peikun, et al.
Pubblicazione: (2024)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
di: Wang, Yongqi, et al.
Pubblicazione: (2023)
di: Wang, Yongqi, et al.
Pubblicazione: (2023)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
di: Udupa, Sathvik, et al.
Pubblicazione: (2025)
di: Udupa, Sathvik, et al.
Pubblicazione: (2025)
UTDUSS: UTokyo-SaruLab System for Interspeech2024 Speech Processing Using Discrete Speech Unit Challenge
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
di: Wang, Siyang, et al.
Pubblicazione: (2024)
di: Wang, Siyang, et al.
Pubblicazione: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Speech Recognition for Analysis of Police Radio Communication
di: Srivastava, Tejes, et al.
Pubblicazione: (2024)
di: Srivastava, Tejes, et al.
Pubblicazione: (2024)
Compact Speech Translation Models via Discrete Speech Units Pretraining
di: Lam, Tsz Kin, et al.
Pubblicazione: (2024)
di: Lam, Tsz Kin, et al.
Pubblicazione: (2024)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
di: Wang, Wei, et al.
Pubblicazione: (2025)
di: Wang, Wei, et al.
Pubblicazione: (2025)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Absorbing Discrete Diffusion for Speech Enhancement
di: Gonzalez, Philippe
Pubblicazione: (2026)
di: Gonzalez, Philippe
Pubblicazione: (2026)
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
di: Bai, Qibing, et al.
Pubblicazione: (2025)
di: Bai, Qibing, et al.
Pubblicazione: (2025)
EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios
di: Srivastava, Tejes, et al.
Pubblicazione: (2023)
di: Srivastava, Tejes, et al.
Pubblicazione: (2023)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
Documenti analoghi
-
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024) -
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
di: Arora, Siddhant, et al.
Pubblicazione: (2023) -
Improving ASR Contextual Biasing with Guided Attention
di: Tang, Jiyang, et al.
Pubblicazione: (2024) -
On-device Streaming Discrete Speech Units
di: Choi, Kwanghee, et al.
Pubblicazione: (2025) -
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)