Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Zhijie, McIntosh, Stephen, Saito, Daisuke, Minematsu, Nobuaki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
di: Sun, Haitong, et al.
Pubblicazione: (2026)
di: Sun, Haitong, et al.
Pubblicazione: (2026)
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
di: Park, Joonyong, et al.
Pubblicazione: (2024)
di: Park, Joonyong, et al.
Pubblicazione: (2024)
A Pilot Study of Applying Sequence-to-Sequence Voice Conversion to Evaluate the Intelligibility of L2 Speech Using a Native Speaker's Shadowings
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2024)
di: Onda, Kentaro, et al.
Pubblicazione: (2024)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
di: Geng, Haopeng, et al.
Pubblicazione: (2025)
di: Geng, Haopeng, et al.
Pubblicazione: (2025)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model
di: Park, Joonyong, et al.
Pubblicazione: (2025)
di: Park, Joonyong, et al.
Pubblicazione: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
di: Poli, Maxime, et al.
Pubblicazione: (2024)
di: Poli, Maxime, et al.
Pubblicazione: (2024)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
di: Geng, Haopeng, et al.
Pubblicazione: (2026)
di: Geng, Haopeng, et al.
Pubblicazione: (2026)
On The Landscape of Spoken Language Models: A Comprehensive Survey
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Factorized RVQ-GAN For Disentangled Speech Tokenization
di: Khurana, Sameer, et al.
Pubblicazione: (2025)
di: Khurana, Sameer, et al.
Pubblicazione: (2025)
Spirit LM: Interleaved Spoken and Written Language Model
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
di: Nguyen, Tu Anh, et al.
Pubblicazione: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024)
di: Park, Se Jin, et al.
Pubblicazione: (2024)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
di: Chang, Heng-Jui, et al.
Pubblicazione: (2024)
di: Chang, Heng-Jui, et al.
Pubblicazione: (2024)
Implicit Self-supervised Language Representation for Spoken Language Diarization
di: Mishra, Jagabandhu, et al.
Pubblicazione: (2023)
di: Mishra, Jagabandhu, et al.
Pubblicazione: (2023)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
di: Lu, Haitian, et al.
Pubblicazione: (2025)
di: Lu, Haitian, et al.
Pubblicazione: (2025)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
di: Shon, Suwon, et al.
Pubblicazione: (2024)
di: Shon, Suwon, et al.
Pubblicazione: (2024)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022)
di: Nie, Yuting, et al.
Pubblicazione: (2022)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision
di: Poli, Maxime, et al.
Pubblicazione: (2025)
di: Poli, Maxime, et al.
Pubblicazione: (2025)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
di: Arora, Siddhant, et al.
Pubblicazione: (2023)
di: Arora, Siddhant, et al.
Pubblicazione: (2023)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
di: Jung, Yeonjoon, et al.
Pubblicazione: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
di: Le, Trang, et al.
Pubblicazione: (2024)
di: Le, Trang, et al.
Pubblicazione: (2024)
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
"Alexa, can you forget me?" Machine Unlearning Benchmark in Spoken Language Understanding
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
di: Mousavi, Pooneh, et al.
Pubblicazione: (2025)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
di: Valente, Martina, et al.
Pubblicazione: (2024)
di: Valente, Martina, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
di: Sun, Haitong, et al.
Pubblicazione: (2026) -
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025) -
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
di: Park, Joonyong, et al.
Pubblicazione: (2024) -
A Pilot Study of Applying Sequence-to-Sequence Voice Conversion to Evaluate the Intelligibility of L2 Speech Using a Native Speaker's Shadowings
di: Geng, Haopeng, et al.
Pubblicazione: (2024) -
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2024)