MOSS-TTSD: Text to Spoken Dialogue Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yuqian, Yu, Donghua, Lin, Zhengyuan, Jiang, Botian, Chen, Mingshu, Jiang, Yaozhou, Zhao, Yiwei, Zhang, Yiyang, Yuan, Yucheng, Chen, Hanfu, Huang, Kexin, Zhan, Jun, Chang, Cheng, Fei, Zhaoye, Li, Shimin, Yang, Xiaogui, Cheng, Qinyuan, Qiu, Xipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
di: Huang, Kexin, et al.
Pubblicazione: (2026)
di: Huang, Kexin, et al.
Pubblicazione: (2026)
MOSS-TTS Technical Report
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026)
di: Yang, Chen, et al.
Pubblicazione: (2026)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
di: Zhao, Xingjian, et al.
Pubblicazione: (2025)
di: Zhao, Xingjian, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
MOSS Transcribe Diarize Technical Report
di: AI, MOSI., et al.
Pubblicazione: (2026)
di: AI, MOSI., et al.
Pubblicazione: (2026)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
di: Yang, Chenchen, et al.
Pubblicazione: (2026)
di: Yang, Chenchen, et al.
Pubblicazione: (2026)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
di: Huang, Kexin, et al.
Pubblicazione: (2025)
di: Huang, Kexin, et al.
Pubblicazione: (2025)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
di: Zhan, Jun, et al.
Pubblicazione: (2025)
di: Zhan, Jun, et al.
Pubblicazione: (2025)
Agent Alignment in Evolving Social Norms
di: Li, Shimin, et al.
Pubblicazione: (2024)
di: Li, Shimin, et al.
Pubblicazione: (2024)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
di: Gong, Yitian, et al.
Pubblicazione: (2025)
di: Gong, Yitian, et al.
Pubblicazione: (2025)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
di: Deng, Ruifan, et al.
Pubblicazione: (2025)
di: Deng, Ruifan, et al.
Pubblicazione: (2025)
How to Mitigate Overfitting in Weak-to-strong Generalization?
di: Shi, Junhao, et al.
Pubblicazione: (2025)
di: Shi, Junhao, et al.
Pubblicazione: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
di: Wang, Yikun, et al.
Pubblicazione: (2025)
di: Wang, Yikun, et al.
Pubblicazione: (2025)
Oligonucleotide‐Based Modulation of Macrophage Polarization: Emerging Strategies in Immunotherapy
di: Hanfu Zhang, et al.
Pubblicazione: (2025)
di: Hanfu Zhang, et al.
Pubblicazione: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
di: OpenMOSS Team, et al.
Pubblicazione: (2026)
di: OpenMOSS Team, et al.
Pubblicazione: (2026)
WavChat: A Survey of Spoken Dialogue Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Can AI Assistants Know What They Don't Know?
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
WavReward: Spoken Dialogue Models With Generalist Reward Evaluators
di: Ji, Shengpeng, et al.
Pubblicazione: (2025)
di: Ji, Shengpeng, et al.
Pubblicazione: (2025)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
di: Lu, Haitian, et al.
Pubblicazione: (2025)
di: Lu, Haitian, et al.
Pubblicazione: (2025)
To Defer or To Shift? The Role of AI Data Center Flexibility on Grid Interconnection
di: Chen, Yize, et al.
Pubblicazione: (2026)
di: Chen, Yize, et al.
Pubblicazione: (2026)
Towards a Japanese Full-duplex Spoken Dialogue System
di: Ohashi, Atsumoto, et al.
Pubblicazione: (2025)
di: Ohashi, Atsumoto, et al.
Pubblicazione: (2025)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
di: Wu, Donghang, et al.
Pubblicazione: (2025)
di: Wu, Donghang, et al.
Pubblicazione: (2025)
Joint Beamforming and Position Design for Movable Antenna Assisted LEO ISAC Systems
di: Zhang, Hanfu, et al.
Pubblicazione: (2025)
di: Zhang, Hanfu, et al.
Pubblicazione: (2025)
LLM can Achieve Self-Regulation via Hyperparameter Aware Generation
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2024)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness
di: Lu, Jingyu, et al.
Pubblicazione: (2026)
di: Lu, Jingyu, et al.
Pubblicazione: (2026)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
Are LLMs Robust for Spoken Dialogues?
di: Mousavi, Seyed Mahed, et al.
Pubblicazione: (2024)
di: Mousavi, Seyed Mahed, et al.
Pubblicazione: (2024)
Instructive Dialogue Summarization with Query Aggregations
di: Wang, Bin, et al.
Pubblicazione: (2023)
di: Wang, Bin, et al.
Pubblicazione: (2023)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
di: Nakata, Wataru, et al.
Pubblicazione: (2024)
Unified Active Retrieval for Retrieval Augmented Generation
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
TiCo: Time-Controllable Spoken Dialogue Model
di: Chang, Kai-Wei, et al.
Pubblicazione: (2026)
di: Chang, Kai-Wei, et al.
Pubblicazione: (2026)
Dynamic and Generalizable Process Reward Modeling
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
di: Huang, Kexin, et al.
Pubblicazione: (2026) -
MOSS-TTS Technical Report
di: Gong, Yitian, et al.
Pubblicazione: (2026) -
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026) -
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
di: Zhao, Xingjian, et al.
Pubblicazione: (2025) -
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)