Slamming: Training a Speech Language Model on One GPU in a Day
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Maimon, Gallil, Elmakies, Avishai, Adi, Yossi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
par: Elmakies, Avishai, et autres
Publié: (2025)
par: Elmakies, Avishai, et autres
Publié: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
par: Yosha, Iddo, et autres
Publié: (2025)
par: Yosha, Iddo, et autres
Publié: (2025)
Salmon: A Suite for Acoustic Language Model Evaluation
par: Maimon, Gallil, et autres
Publié: (2024)
par: Maimon, Gallil, et autres
Publié: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
par: Elmakies, Avishai, et autres
Publié: (2025)
par: Elmakies, Avishai, et autres
Publié: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
par: Har-Tuv, Nadav, et autres
Publié: (2025)
par: Har-Tuv, Nadav, et autres
Publié: (2025)
LAST: Language Model Aware Speech Tokenization
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2025)
par: Tal, Or, et autres
Publié: (2025)
Textually Pretrained Speech Language Models
par: Hassid, Michael, et autres
Publié: (2023)
par: Hassid, Michael, et autres
Publié: (2023)
An Independence-promoting Loss for Music Generation with Language Models
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
Discrete Audio Tokens: More Than a Survey!
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
par: Kim, Taesoo, et autres
Publié: (2025)
par: Kim, Taesoo, et autres
Publié: (2025)
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
par: Toyin, Hawau Olamide, et autres
Publié: (2024)
par: Toyin, Hawau Olamide, et autres
Publié: (2024)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
par: Rufai, Amina Mardiyyah, et autres
Publié: (2020)
par: Rufai, Amina Mardiyyah, et autres
Publié: (2020)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
Joint Fine-tuning and Conversion of Pretrained Speech and Language Models towards Linear Complexity
par: He, Mutian, et autres
Publié: (2024)
par: He, Mutian, et autres
Publié: (2024)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
par: Ju, Zeqian, et autres
Publié: (2024)
par: Ju, Zeqian, et autres
Publié: (2024)
QUADS: QUAntized Distillation Framework for Efficient Speech Language Understanding
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
par: Hsiao, Chi-Yuan, et autres
Publié: (2025)
par: Hsiao, Chi-Yuan, et autres
Publié: (2025)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024)
par: Roth, Amit, et autres
Publié: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
par: Ye, Zhen, et autres
Publié: (2024)
par: Ye, Zhen, et autres
Publié: (2024)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
par: Jia, Dongya, et autres
Publié: (2025)
par: Jia, Dongya, et autres
Publié: (2025)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
par: Peng, Puyuan, et autres
Publié: (2024)
par: Peng, Puyuan, et autres
Publié: (2024)
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
par: Wang, Mingxuan, et autres
Publié: (2025)
par: Wang, Mingxuan, et autres
Publié: (2025)
Can a Machine Distinguish High and Low Amount of Social Creak in Speech?
par: Laukkanen, Anne-Maria, et autres
Publié: (2024)
par: Laukkanen, Anne-Maria, et autres
Publié: (2024)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Foundation Model Training on EU Languages
par: Gaido, Marco, et autres
Publié: (2024)
par: Gaido, Marco, et autres
Publié: (2024)
Spoken Language Intelligence of Large Language Models for Language Learning
par: Peng, Linkai, et autres
Publié: (2023)
par: Peng, Linkai, et autres
Publié: (2023)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
par: Xie, Tianxin, et autres
Publié: (2024)
par: Xie, Tianxin, et autres
Publié: (2024)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
Documents similaires
-
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
par: Elmakies, Avishai, et autres
Publié: (2025) -
StressTest: Can YOUR Speech LM Handle the Stress?
par: Yosha, Iddo, et autres
Publié: (2025) -
Salmon: A Suite for Acoustic Language Model Evaluation
par: Maimon, Gallil, et autres
Publié: (2024) -
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025) -
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
par: Elmakies, Avishai, et autres
Publié: (2025)