MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts
Fuente:
arXiv
Guardado en:
| Autores principales: | Lou, Yuxuan, Yang, Kai, You, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
por: Gu, Zijin, et al.
Publicado: (2025)
por: Gu, Zijin, et al.
Publicado: (2025)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation
por: Le-Duc, Khai, et al.
Publicado: (2025)
por: Le-Duc, Khai, et al.
Publicado: (2025)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
por: Jawaid, Ahad, et al.
Publicado: (2024)
por: Jawaid, Ahad, et al.
Publicado: (2024)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
por: Chen, Szu-Chi, et al.
Publicado: (2026)
por: Chen, Szu-Chi, et al.
Publicado: (2026)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
por: Peng, Puyuan, et al.
Publicado: (2024)
por: Peng, Puyuan, et al.
Publicado: (2024)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
por: Elmakies, Avishai, et al.
Publicado: (2025)
por: Elmakies, Avishai, et al.
Publicado: (2025)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
por: Weise, Tobias, et al.
Publicado: (2024)
por: Weise, Tobias, et al.
Publicado: (2024)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
por: Sun, Yirong, et al.
Publicado: (2025)
por: Sun, Yirong, et al.
Publicado: (2025)
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods
por: Shendabadi, Ali, et al.
Publicado: (2026)
por: Shendabadi, Ali, et al.
Publicado: (2026)
Scaling Rich Style-Prompted Text-to-Speech Datasets
por: Diwan, Anuj, et al.
Publicado: (2025)
por: Diwan, Anuj, et al.
Publicado: (2025)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
por: Ju, Zeqian, et al.
Publicado: (2024)
por: Ju, Zeqian, et al.
Publicado: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
por: Nam, KiHyun, et al.
Publicado: (2025)
por: Nam, KiHyun, et al.
Publicado: (2025)
Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts
por: Jin, Hojun, et al.
Publicado: (2025)
por: Jin, Hojun, et al.
Publicado: (2025)
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings
por: Zhu, Yonggang, et al.
Publicado: (2026)
por: Zhu, Yonggang, et al.
Publicado: (2026)
Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
por: Liu, Baihui, et al.
Publicado: (2026)
por: Liu, Baihui, et al.
Publicado: (2026)
PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems
por: Mitsui, Kentaro, et al.
Publicado: (2024)
por: Mitsui, Kentaro, et al.
Publicado: (2024)
CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
por: Lee, Keon, et al.
Publicado: (2024)
por: Lee, Keon, et al.
Publicado: (2024)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
por: Jia, Dongya, et al.
Publicado: (2025)
por: Jia, Dongya, et al.
Publicado: (2025)
Learning When to Think While Listening in Large Audio-Language Models
por: Song, Zhiyuan, et al.
Publicado: (2026)
por: Song, Zhiyuan, et al.
Publicado: (2026)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
MoIN: Mixture of Introvert Experts to Upcycle an LLM
por: Tejankar, Ajinkya, et al.
Publicado: (2024)
por: Tejankar, Ajinkya, et al.
Publicado: (2024)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR
por: Lee, Jaeyoung, et al.
Publicado: (2026)
por: Lee, Jaeyoung, et al.
Publicado: (2026)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting
por: Yang, Chao-Han Huck, et al.
Publicado: (2023)
por: Yang, Chao-Han Huck, et al.
Publicado: (2023)
Arabic Little STT: Arabic Children Speech Recognition Dataset
por: Alkadri, Mouhand, et al.
Publicado: (2025)
por: Alkadri, Mouhand, et al.
Publicado: (2025)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
por: Elmakies, Avishai, et al.
Publicado: (2025)
por: Elmakies, Avishai, et al.
Publicado: (2025)
MobileMoE: Scaling On-Device Mixture of Experts
por: Chen, Yanbei, et al.
Publicado: (2026)
por: Chen, Yanbei, et al.
Publicado: (2026)
Ejemplares similares
-
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
por: Lou, Yuxuan, et al.
Publicado: (2026) -
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
por: Gu, Zijin, et al.
Publicado: (2025) -
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
por: Lou, Haowei, et al.
Publicado: (2024) -
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
por: Lou, Haowei, et al.
Publicado: (2024) -
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)