LAST: Language Model Aware Speech Tokenization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Turetzky, Arnon, Adi, Yossi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024)
par: Roth, Amit, et autres
Publié: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
par: Har-Tuv, Nadav, et autres
Publié: (2025)
par: Har-Tuv, Nadav, et autres
Publié: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
par: Yosha, Iddo, et autres
Publié: (2025)
par: Yosha, Iddo, et autres
Publié: (2025)
Salmon: A Suite for Acoustic Language Model Evaluation
par: Maimon, Gallil, et autres
Publié: (2024)
par: Maimon, Gallil, et autres
Publié: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
par: Elmakies, Avishai, et autres
Publié: (2025)
par: Elmakies, Avishai, et autres
Publié: (2025)
WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
par: Yosha, Iddo, et autres
Publié: (2025)
par: Yosha, Iddo, et autres
Publié: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Textually Pretrained Speech Language Models
par: Hassid, Michael, et autres
Publié: (2023)
par: Hassid, Michael, et autres
Publié: (2023)
On The Landscape of Spoken Language Models: A Comprehensive Survey
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
SSR: Alignment-Aware Modality Connector for Speech Language Models
par: Tan, Weiting, et autres
Publié: (2024)
par: Tan, Weiting, et autres
Publié: (2024)
Frontend Token Enhancement for Token-Based Speech Recognition
par: Ashihara, Takanori, et autres
Publié: (2026)
par: Ashihara, Takanori, et autres
Publié: (2026)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
par: Wang, Dingdong, et autres
Publié: (2024)
par: Wang, Dingdong, et autres
Publié: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
STAB: Speech Tokenizer Assessment Benchmark
par: Vashishth, Shikhar, et autres
Publié: (2024)
par: Vashishth, Shikhar, et autres
Publié: (2024)
Next Tokens Denoising for Speech Synthesis
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
Speech Synthesis From Continuous Features Using Per-Token Latent Diffusion
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Factorized RVQ-GAN For Disentangled Speech Tokenization
par: Khurana, Sameer, et autres
Publié: (2025)
par: Khurana, Sameer, et autres
Publié: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Children's Speech Recognition through Discrete Token Enhancement
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
par: Zhong, Jinzuomu, et autres
Publié: (2026)
par: Zhong, Jinzuomu, et autres
Publié: (2026)
Representing Speech Through Autoregressive Prediction of Cochlear Tokens
par: Tuckute, Greta, et autres
Publié: (2025)
par: Tuckute, Greta, et autres
Publié: (2025)
Generalized Multilingual Text-to-Speech Generation with Language-Aware Style Adaptation
par: Lou, Haowei, et autres
Publié: (2025)
par: Lou, Haowei, et autres
Publié: (2025)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
par: Huang, Zhijie, et autres
Publié: (2026)
par: Huang, Zhijie, et autres
Publié: (2026)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
par: Ling, Shaoshi, et autres
Publié: (2025)
par: Ling, Shaoshi, et autres
Publié: (2025)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Speech Language Models for Under-Represented Languages: Insights from Wolof
par: Sy, Yaya, et autres
Publié: (2025)
par: Sy, Yaya, et autres
Publié: (2025)
Documents similaires
-
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024) -
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024) -
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
par: Turetzky, Arnon, et autres
Publié: (2024) -
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025) -
PAST: Phonetic-Acoustic Speech Tokenizer
par: Har-Tuv, Nadav, et autres
Publié: (2025)