Salvato in:
| Autori principali: | He, Jiaxu, Wang, Chao, Lian, Jie, Cai, Yuqing, Li, Yongxiang, Duojie, Renzeg, Li, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.02496 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
di: Song, Yaodong, et al.
Pubblicazione: (2025)
di: Song, Yaodong, et al.
Pubblicazione: (2025)
Context-Aware Dynamic Chunking for Streaming Tibetan Speech Recognition
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
BoSS: Beyond-Semantic Speech
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction
di: Wang, Qing, et al.
Pubblicazione: (2026)
di: Wang, Qing, et al.
Pubblicazione: (2026)
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
Tibetan Language and AI: A Comprehensive Survey of Resources, Methods and Challenges
di: Huang, Cheng, et al.
Pubblicazione: (2025)
di: Huang, Cheng, et al.
Pubblicazione: (2025)
TLUE: A Tibetan Language Understanding Evaluation Benchmark
di: Gao, Fan, et al.
Pubblicazione: (2025)
di: Gao, Fan, et al.
Pubblicazione: (2025)
A2TTS: TTS for Low Resource Indian Languages
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025)
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
di: Li, Yingting, et al.
Pubblicazione: (2024)
di: Li, Yingting, et al.
Pubblicazione: (2024)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
di: Xu, Tianyi, et al.
Pubblicazione: (2025)
di: Xu, Tianyi, et al.
Pubblicazione: (2025)
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
di: Di, Xinhan, et al.
Pubblicazione: (2024)
di: Di, Xinhan, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
RephraseTTS: Dynamic Length Text based Speech Insertion with Speaker Style Transfer
di: Matiyali, Neeraj, et al.
Pubblicazione: (2025)
di: Matiyali, Neeraj, et al.
Pubblicazione: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
TELEVAL: A Dynamic Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios
di: Li, Zehan, et al.
Pubblicazione: (2025)
di: Li, Zehan, et al.
Pubblicazione: (2025)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
MunTTS: A Text-to-Speech System for Mundari
di: Gumma, Varun, et al.
Pubblicazione: (2024)
di: Gumma, Varun, et al.
Pubblicazione: (2024)
Borderless Long Speech Synthesis
di: Song, Xingchen, et al.
Pubblicazione: (2026)
di: Song, Xingchen, et al.
Pubblicazione: (2026)
DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Factorized Discrete Flow Matching
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2025)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2025)
Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource Languages
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
MOSS-TTS Technical Report
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
di: Wang, Jialing, et al.
Pubblicazione: (2026)
di: Wang, Jialing, et al.
Pubblicazione: (2026)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
di: Chen, Ziqi, et al.
Pubblicazione: (2025)
di: Chen, Ziqi, et al.
Pubblicazione: (2025)
Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages
di: Sankaran, Aditya Narayan, et al.
Pubblicazione: (2026)
di: Sankaran, Aditya Narayan, et al.
Pubblicazione: (2026)
Learning More with Less: Self-Supervised Approaches for Low-Resource Speech Emotion Recognition
di: Gong, Ziwei, et al.
Pubblicazione: (2025)
di: Gong, Ziwei, et al.
Pubblicazione: (2025)
Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness
di: Feng, Xincan, et al.
Pubblicazione: (2024)
di: Feng, Xincan, et al.
Pubblicazione: (2024)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
di: Song, Xingchen, et al.
Pubblicazione: (2024)
di: Song, Xingchen, et al.
Pubblicazione: (2024)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
di: Dao, Alan, et al.
Pubblicazione: (2025)
di: Dao, Alan, et al.
Pubblicazione: (2025)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025)
di: Sung, Hung-Yang, et al.
Pubblicazione: (2025)
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
di: Zhong, Yi, et al.
Pubblicazione: (2023)
di: Zhong, Yi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
di: Song, Yaodong, et al.
Pubblicazione: (2025) -
Context-Aware Dynamic Chunking for Streaming Tibetan Speech Recognition
di: Wang, Chao, et al.
Pubblicazione: (2025) -
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
di: Liu, Yutong, et al.
Pubblicazione: (2025) -
BoSS: Beyond-Semantic Speech
di: Wang, Qing, et al.
Pubblicazione: (2025) -
A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction
di: Wang, Qing, et al.
Pubblicazione: (2026)