Guardado en:
| Autores principales: | Wang, Mingxuan, Nakamura, Satoshi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.06201 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
Scaling Speech Tokenizers with Diffusion Autoencoders
por: Wang, Yuancheng, et al.
Publicado: (2026)
por: Wang, Yuancheng, et al.
Publicado: (2026)
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024)
por: Bai, Richard He, et al.
Publicado: (2024)
Discrete Audio Tokens: More Than a Survey!
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
por: Lin, Yueqian, et al.
Publicado: (2024)
por: Lin, Yueqian, et al.
Publicado: (2024)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
por: Chang, Heng-Jui, et al.
Publicado: (2024)
por: Chang, Heng-Jui, et al.
Publicado: (2024)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
por: Ahasan, Md Mubtasim, et al.
Publicado: (2024)
por: Ahasan, Md Mubtasim, et al.
Publicado: (2024)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
por: Wang, Qichao, et al.
Publicado: (2025)
por: Wang, Qichao, et al.
Publicado: (2025)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
por: Gong, Hongyu, et al.
Publicado: (2024)
por: Gong, Hongyu, et al.
Publicado: (2024)
Discrete Speech Unit Extraction via Independent Component Analysis
por: Nakamura, Tomohiko, et al.
Publicado: (2025)
por: Nakamura, Tomohiko, et al.
Publicado: (2025)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
por: Elmakies, Avishai, et al.
Publicado: (2025)
por: Elmakies, Avishai, et al.
Publicado: (2025)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
por: Wang, Dingdong, et al.
Publicado: (2024)
por: Wang, Dingdong, et al.
Publicado: (2024)
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
por: Elmakies, Avishai, et al.
Publicado: (2025)
por: Elmakies, Avishai, et al.
Publicado: (2025)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
por: Kim, Taesoo, et al.
Publicado: (2025)
por: Kim, Taesoo, et al.
Publicado: (2025)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
por: Ju, Zeqian, et al.
Publicado: (2024)
por: Ju, Zeqian, et al.
Publicado: (2024)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
por: Jia, Dongya, et al.
Publicado: (2025)
por: Jia, Dongya, et al.
Publicado: (2025)
Token-Based Audio Inpainting via Discrete Diffusion
por: Dror, Tali, et al.
Publicado: (2025)
por: Dror, Tali, et al.
Publicado: (2025)
Rethinking Discrete Speech Representation Tokens for Accent Generation
por: Zhong, Jinzuomu, et al.
Publicado: (2026)
por: Zhong, Jinzuomu, et al.
Publicado: (2026)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
Benchmarking Prosody Encoding in Discrete Speech Tokens
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
por: Peng, Puyuan, et al.
Publicado: (2024)
por: Peng, Puyuan, et al.
Publicado: (2024)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention
por: Ioannides, Georgios, et al.
Publicado: (2025)
por: Ioannides, Georgios, et al.
Publicado: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Slamming: Training a Speech Language Model on One GPU in a Day
por: Maimon, Gallil, et al.
Publicado: (2025)
por: Maimon, Gallil, et al.
Publicado: (2025)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting
por: Yang, Chao-Han Huck, et al.
Publicado: (2023)
por: Yang, Chao-Han Huck, et al.
Publicado: (2023)
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
Joint Fine-tuning and Conversion of Pretrained Speech and Language Models towards Linear Complexity
por: He, Mutian, et al.
Publicado: (2024)
por: He, Mutian, et al.
Publicado: (2024)
On the Role of Speech Data in Reducing Toxicity Detection Bias
por: Bell, Samuel J., et al.
Publicado: (2024)
por: Bell, Samuel J., et al.
Publicado: (2024)
Ejemplares similares
-
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
por: Xin, Detai, et al.
Publicado: (2024) -
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025) -
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024) -
Scaling Speech Tokenizers with Diffusion Autoencoders
por: Wang, Yuancheng, et al.
Publicado: (2026) -
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024)