ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Visser, Nicol, Malan, Simon, Slabbert, Danel, Kamper, Herman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unsupervised lexicon learning from speech is limited by representations rather than clustering
di: Slabbert, Danel, et al.
Pubblicazione: (2025)
di: Slabbert, Danel, et al.
Pubblicazione: (2025)
Spoken Language Modeling with Duration-Penalized Self-Supervised Units
di: Visser, Nicol, et al.
Pubblicazione: (2025)
di: Visser, Nicol, et al.
Pubblicazione: (2025)
Unsupervised Word Discovery: Boundary Detection with Clustering vs. Dynamic Programming
di: Malan, Simon, et al.
Pubblicazione: (2024)
di: Malan, Simon, et al.
Pubblicazione: (2024)
Should Top-Down Clustering Affect Boundaries in Unsupervised Word Discovery?
di: Malan, Simon, et al.
Pubblicazione: (2025)
di: Malan, Simon, et al.
Pubblicazione: (2025)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
Translating speech with just images
di: Oneata, Dan, et al.
Pubblicazione: (2024)
di: Oneata, Dan, et al.
Pubblicazione: (2024)
Disentanglement in a GAN for Unconditional Speech Synthesis
di: Baas, Matthew, et al.
Pubblicazione: (2023)
di: Baas, Matthew, et al.
Pubblicazione: (2023)
Scaling Spoken Language Models with Syllabic Speech Tokenization
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
Visually grounded few-shot word learning in low-resource settings
di: Nortje, Leanne, et al.
Pubblicazione: (2023)
di: Nortje, Leanne, et al.
Pubblicazione: (2023)
Towards few-shot isolated word reading assessment
di: Smit, Reuben, et al.
Pubblicazione: (2025)
di: Smit, Reuben, et al.
Pubblicazione: (2025)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
Visually Grounded Speech Models have a Mutual Exclusivity Bias
di: Nortje, Leanne, et al.
Pubblicazione: (2024)
di: Nortje, Leanne, et al.
Pubblicazione: (2024)
Revisiting speech segmentation and lexicon learning with better features
di: Kamper, Herman, et al.
Pubblicazione: (2024)
di: Kamper, Herman, et al.
Pubblicazione: (2024)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
The mutual exclusivity bias of bilingual visually grounded speech models
di: Oneata, Dan, et al.
Pubblicazione: (2025)
di: Oneata, Dan, et al.
Pubblicazione: (2025)
Interpreting Speaker Characteristics in the Dimensions of Self-Supervised Speech Features
di: van Rensburg, Kyle Janse, et al.
Pubblicazione: (2026)
di: van Rensburg, Kyle Janse, et al.
Pubblicazione: (2026)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model
di: Baas, Matthew, et al.
Pubblicazione: (2025)
di: Baas, Matthew, et al.
Pubblicazione: (2025)
LinearVC: Linear transformations of self-supervised features through the lens of voice conversion
di: Kamper, Herman, et al.
Pubblicazione: (2025)
di: Kamper, Herman, et al.
Pubblicazione: (2025)
Improved Visually Prompted Keyword Localisation in Real Low-Resource Settings
di: Nortje, Leanne, et al.
Pubblicazione: (2024)
di: Nortje, Leanne, et al.
Pubblicazione: (2024)
Sylber 2.0: A Universal Syllable Embedding
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
di: Poli, Maxime, et al.
Pubblicazione: (2024)
di: Poli, Maxime, et al.
Pubblicazione: (2024)
Spoken-Term Discovery using Discrete Speech Units
di: van Niekerk, Benjamin, et al.
Pubblicazione: (2024)
di: van Niekerk, Benjamin, et al.
Pubblicazione: (2024)
Towards Hierarchical Spoken Language Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
di: Lin, Guan-Ting, et al.
Pubblicazione: (2023)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2023)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
Automatically assessing oral narratives of Afrikaans and isiXhosa children
di: Louw, Retief, et al.
Pubblicazione: (2025)
di: Louw, Retief, et al.
Pubblicazione: (2025)
Feature-based analysis of oral narratives from Afrikaans and isiXhosa children
di: Sharratt, Emma, et al.
Pubblicazione: (2025)
di: Sharratt, Emma, et al.
Pubblicazione: (2025)
SyllableLM: Learning Coarse Semantic Units for Speech Language Models
di: Baade, Alan, et al.
Pubblicazione: (2024)
di: Baade, Alan, et al.
Pubblicazione: (2024)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
di: He, Jianfeng, et al.
Pubblicazione: (2023)
di: He, Jianfeng, et al.
Pubblicazione: (2023)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
di: Corrêa, Pedro, et al.
Pubblicazione: (2025)
di: Corrêa, Pedro, et al.
Pubblicazione: (2025)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
di: Sildam, Tiia, et al.
Pubblicazione: (2024)
di: Sildam, Tiia, et al.
Pubblicazione: (2024)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
di: Zhu, Han, et al.
Pubblicazione: (2026)
di: Zhu, Han, et al.
Pubblicazione: (2026)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2026)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2026)
Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model
di: Futami, Hayato, et al.
Pubblicazione: (2024)
di: Futami, Hayato, et al.
Pubblicazione: (2024)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2025)
di: Yang, Yifan, et al.
Pubblicazione: (2025)
Prompting Whisper for QA-driven Zero-shot End-to-end Spoken Language Understanding
di: Li, Mohan, et al.
Pubblicazione: (2024)
di: Li, Mohan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Unsupervised lexicon learning from speech is limited by representations rather than clustering
di: Slabbert, Danel, et al.
Pubblicazione: (2025) -
Spoken Language Modeling with Duration-Penalized Self-Supervised Units
di: Visser, Nicol, et al.
Pubblicazione: (2025) -
Unsupervised Word Discovery: Boundary Detection with Clustering vs. Dynamic Programming
di: Malan, Simon, et al.
Pubblicazione: (2024) -
Should Top-Down Clustering Affect Boundaries in Unsupervised Word Discovery?
di: Malan, Simon, et al.
Pubblicazione: (2025) -
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
di: Huang, Zhijie, et al.
Pubblicazione: (2026)