VocalNet-MDM: Accelerating Streaming Speech LLM via Self-Distilled Masked Diffusion Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Ziyang, Wang, Yuhao, Liu, Heyang, Wu, Ronghua, Gu, Qunshan, Wang, Yanfeng, Wang, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
por: Hou, Yixuan, et al.
Publicado: (2025)
por: Hou, Yixuan, et al.
Publicado: (2025)
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
por: Liu, Heyang, et al.
Publicado: (2025)
por: Liu, Heyang, et al.
Publicado: (2025)
VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context
por: Liu, Heyang, et al.
Publicado: (2025)
por: Liu, Heyang, et al.
Publicado: (2025)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
por: Liu, Heyang, et al.
Publicado: (2025)
por: Liu, Heyang, et al.
Publicado: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
por: Liu, Heyang, et al.
Publicado: (2024)
por: Liu, Heyang, et al.
Publicado: (2024)
LaSR: Context-Aware Speech Recognition via Latent Reasoning
por: Liu, Heyang, et al.
Publicado: (2026)
por: Liu, Heyang, et al.
Publicado: (2026)
NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations
por: Xue, Liumeng, et al.
Publicado: (2026)
por: Xue, Liumeng, et al.
Publicado: (2026)
VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency
por: Liu, Hongcheng, et al.
Publicado: (2025)
por: Liu, Hongcheng, et al.
Publicado: (2025)
Towards an End-to-End Framework for Invasive Brain Signal Decoding with Large Language Models
por: Feng, Sheng, et al.
Publicado: (2024)
por: Feng, Sheng, et al.
Publicado: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
por: Shi, Yufei, et al.
Publicado: (2026)
por: Shi, Yufei, et al.
Publicado: (2026)
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
por: Wang, Jialing, et al.
Publicado: (2026)
por: Wang, Jialing, et al.
Publicado: (2026)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
por: Guo, Dake, et al.
Publicado: (2025)
por: Guo, Dake, et al.
Publicado: (2025)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
por: Zheng, Qixi, et al.
Publicado: (2025)
por: Zheng, Qixi, et al.
Publicado: (2025)
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
por: Wang, Qi, et al.
Publicado: (2026)
por: Wang, Qi, et al.
Publicado: (2026)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
Decoding Linguistic Representations of Human Brain
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation
por: Cheng, Changhao, et al.
Publicado: (2026)
por: Cheng, Changhao, et al.
Publicado: (2026)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
por: Yang, Yudong, et al.
Publicado: (2024)
por: Yang, Yudong, et al.
Publicado: (2024)
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
por: Wang, Haotian, et al.
Publicado: (2025)
por: Wang, Haotian, et al.
Publicado: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling
por: Fan, Xiaoyu, et al.
Publicado: (2026)
por: Fan, Xiaoyu, et al.
Publicado: (2026)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026)
por: Ni, Qinke, et al.
Publicado: (2026)
Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations
por: Cho, Deok-Hyeon, et al.
Publicado: (2026)
por: Cho, Deok-Hyeon, et al.
Publicado: (2026)
NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations
por: Liao, Huan, et al.
Publicado: (2025)
por: Liao, Huan, et al.
Publicado: (2025)
Selective Masking Adversarial Attack on Automatic Speech Recognition Systems
por: Fang, Zheng, et al.
Publicado: (2025)
por: Fang, Zheng, et al.
Publicado: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
por: Wang, Ju-Chiang, et al.
Publicado: (2024)
por: Wang, Ju-Chiang, et al.
Publicado: (2024)
Unsupervised Multi-channel Speech Dereverberation via Diffusion
por: Wu, Yulun, et al.
Publicado: (2025)
por: Wu, Yulun, et al.
Publicado: (2025)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
por: Chen, Wenxi, et al.
Publicado: (2025)
por: Chen, Wenxi, et al.
Publicado: (2025)
Efficient Streaming LLM for Speech Recognition
por: Jia, Junteng, et al.
Publicado: (2024)
por: Jia, Junteng, et al.
Publicado: (2024)
Uni-ASR: Unified LLM-Based Architecture for Non-Streaming and Streaming Automatic Speech Recognition
por: Xia, Yinfeng, et al.
Publicado: (2026)
por: Xia, Yinfeng, et al.
Publicado: (2026)
Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval
por: Xiao, Boda, et al.
Publicado: (2026)
por: Xiao, Boda, et al.
Publicado: (2026)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
por: Chen, Szu-Chi, et al.
Publicado: (2026)
por: Chen, Szu-Chi, et al.
Publicado: (2026)
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
Ejemplares similares
-
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
por: Wang, Yuhao, et al.
Publicado: (2025) -
VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
por: Wang, Yuhao, et al.
Publicado: (2025) -
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
por: Hou, Yixuan, et al.
Publicado: (2025) -
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
por: Liu, Heyang, et al.
Publicado: (2025) -
VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context
por: Liu, Heyang, et al.
Publicado: (2025)