NAST: Noise Aware Speech Tokenization for Speech Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Messica, Shoval, Adi, Yossi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
PAST: Phonetic-Acoustic Speech Tokenizer
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025)
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
di: Yosha, Iddo, et al.
Pubblicazione: (2025)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Noise-Aware Speech Separation with Contrastive Learning
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
di: Wang, Siyang, et al.
Pubblicazione: (2024)
di: Wang, Siyang, et al.
Pubblicazione: (2024)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
Enhancing TTS Stability in Hebrew using Discrete Semantic Units
di: Zeldes, Ella, et al.
Pubblicazione: (2024)
di: Zeldes, Ella, et al.
Pubblicazione: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
Audio Enhancement from Multiple Crowdsourced Recordings: A Simple and Effective Baseline
di: Aziz, Shiran, et al.
Pubblicazione: (2024)
di: Aziz, Shiran, et al.
Pubblicazione: (2024)
Salmon: A Suite for Acoustic Language Model Evaluation
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
di: Maimon, Gallil, et al.
Pubblicazione: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024)
di: Roth, Amit, et al.
Pubblicazione: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
di: Kando, Shunsuke, et al.
Pubblicazione: (2025)
di: Kando, Shunsuke, et al.
Pubblicazione: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
di: Ding, Shaojin, et al.
Pubblicazione: (2023)
di: Ding, Shaojin, et al.
Pubblicazione: (2023)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
di: Wang, Linqin, et al.
Pubblicazione: (2024)
di: Wang, Linqin, et al.
Pubblicazione: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
Continuous Speech Tokenizer in Text To Speech
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
Rate-Aware Learned Speech Compression
di: Xu, Jun, et al.
Pubblicazione: (2025)
di: Xu, Jun, et al.
Pubblicazione: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
Latent Watermarking of Audio Generative Models
di: Roman, Robin San, et al.
Pubblicazione: (2024)
di: Roman, Robin San, et al.
Pubblicazione: (2024)
Transient Noise Removal via Diffusion-based Speech Inpainting
di: Moradi, Mordehay, et al.
Pubblicazione: (2025)
di: Moradi, Mordehay, et al.
Pubblicazione: (2025)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models
di: Poncelet, Jakob, et al.
Pubblicazione: (2024)
di: Poncelet, Jakob, et al.
Pubblicazione: (2024)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)
di: Tal, Or, et al.
Pubblicazione: (2024)
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024) -
PAST: Phonetic-Acoustic Speech Tokenizer
di: Har-Tuv, Nadav, et al.
Pubblicazione: (2025) -
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025) -
StressTest: Can YOUR Speech LM Handle the Stress?
di: Yosha, Iddo, et al.
Pubblicazione: (2025) -
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)