Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Changsong, Wang, Tianrui, Ni, Ye, Peng, Yizhou, Chng, Eng Siong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
por: Li, Haoyang, et al.
Publicado: (2026)
por: Li, Haoyang, et al.
Publicado: (2026)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
por: Li, Yuxin, et al.
Publicado: (2025)
por: Li, Yuxin, et al.
Publicado: (2025)
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
por: Yuhang, Yang, et al.
Publicado: (2024)
por: Yuhang, Yang, et al.
Publicado: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
por: Kuzmin, Nikita, et al.
Publicado: (2026)
por: Kuzmin, Nikita, et al.
Publicado: (2026)
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
por: Seo, Deokjin, et al.
Publicado: (2026)
por: Seo, Deokjin, et al.
Publicado: (2026)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
por: Yeo, Yue Heng, et al.
Publicado: (2026)
por: Yeo, Yue Heng, et al.
Publicado: (2026)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
por: Truong, Duc-Tuan, et al.
Publicado: (2024)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
por: Liu, Yisi, et al.
Publicado: (2026)
por: Liu, Yisi, et al.
Publicado: (2026)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model
por: Peng, Shuhai, et al.
Publicado: (2026)
por: Peng, Shuhai, et al.
Publicado: (2026)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
A correlation-permutation approach for speech-music encoders model merging
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
por: Arefeen, Ridwan, et al.
Publicado: (2026)
por: Arefeen, Ridwan, et al.
Publicado: (2026)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
por: Liu, Changsong, et al.
Publicado: (2025)
por: Liu, Changsong, et al.
Publicado: (2025)
IndexTTS 2.5 Technical Report
por: Li, Yunpei, et al.
Publicado: (2026)
por: Li, Yunpei, et al.
Publicado: (2026)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection
por: Papi, Sara, et al.
Publicado: (2024)
por: Papi, Sara, et al.
Publicado: (2024)
Efficient Streaming LLM for Speech Recognition
por: Jia, Junteng, et al.
Publicado: (2024)
por: Jia, Junteng, et al.
Publicado: (2024)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
por: Kuzmin, Nikita, et al.
Publicado: (2026)
por: Kuzmin, Nikita, et al.
Publicado: (2026)
Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track
por: Yi, June Young, et al.
Publicado: (2025)
por: Yi, June Young, et al.
Publicado: (2025)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
por: Jin, Sichen, et al.
Publicado: (2024)
por: Jin, Sichen, et al.
Publicado: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
por: Qiang, Chunyu, et al.
Publicado: (2025)
por: Qiang, Chunyu, et al.
Publicado: (2025)
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
por: Hu, Zhetao, et al.
Publicado: (2026)
por: Hu, Zhetao, et al.
Publicado: (2026)
LoRP-TTS: Low-Rank Personalized Text-To-Speech
por: Bondaruk, Łukasz, et al.
Publicado: (2025)
por: Bondaruk, Łukasz, et al.
Publicado: (2025)
SpectroStream: A Versatile Neural Codec for General Audio
por: Li, Yunpeng, et al.
Publicado: (2025)
por: Li, Yunpeng, et al.
Publicado: (2025)
Differentiable Reward Optimization for LLM based TTS system
por: Gao, Changfeng, et al.
Publicado: (2025)
por: Gao, Changfeng, et al.
Publicado: (2025)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
por: Deng, Yayue, et al.
Publicado: (2025)
por: Deng, Yayue, et al.
Publicado: (2025)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
por: Deng, Wei, et al.
Publicado: (2025)
por: Deng, Wei, et al.
Publicado: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
por: Liu, Hanwen, et al.
Publicado: (2026)
por: Liu, Hanwen, et al.
Publicado: (2026)
RRPO: Robust Reward Policy Optimization for LLM-based Emotional TTS
por: Wang, Cong, et al.
Publicado: (2025)
por: Wang, Cong, et al.
Publicado: (2025)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
por: Wang, Haoyu, et al.
Publicado: (2024)
por: Wang, Haoyu, et al.
Publicado: (2024)
Ejemplares similares
-
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
por: Chen, Yukun, et al.
Publicado: (2026) -
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
por: Li, Haoyang, et al.
Publicado: (2026) -
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025) -
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
por: Li, Yuxin, et al.
Publicado: (2025) -
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)