MOSS-TTS Technical Report
Fuente:
arXiv
Saved in:
| Main Authors: | Gong, Yitian, Jiang, Botian, Zhao, Yiwei, Yuan, Yucheng, Chen, Kuangwei, Jiang, Yaozhou, Chang, Cheng, Hong, Dong, Chen, Mingshu, Li, Ruixiao, Zhang, Yiyang, Gao, Yang, Chen, Hanfu, Chen, Ke, Wang, Songlin, Yang, Xiaogui, Zhang, Yuqian, Huang, Kexin, Lin, ZhengYuan, Yu, Kang, Chen, Ziqi, Wang, Jin, Fei, Zhaoye, Cheng, Qinyuan, Li, Shimin, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MOSS-TTSD: Text to Spoken Dialogue Generation
by: Zhang, Yuqian, et al.
Published: (2026)
by: Zhang, Yuqian, et al.
Published: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
by: Gong, Yitian, et al.
Published: (2026)
by: Gong, Yitian, et al.
Published: (2026)
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
by: Huang, Kexin, et al.
Published: (2026)
by: Huang, Kexin, et al.
Published: (2026)
MOSS-Audio Technical Report
by: Yang, Chen, et al.
Published: (2026)
by: Yang, Chen, et al.
Published: (2026)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
by: Zhao, Xingjian, et al.
Published: (2025)
by: Zhao, Xingjian, et al.
Published: (2025)
MOSS Transcribe Diarize Technical Report
by: AI, MOSI., et al.
Published: (2026)
by: AI, MOSI., et al.
Published: (2026)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
by: Yang, Chenchen, et al.
Published: (2026)
by: Yang, Chenchen, et al.
Published: (2026)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
by: Deng, Ruifan, et al.
Published: (2025)
by: Deng, Ruifan, et al.
Published: (2025)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
by: Huang, Kexin, et al.
Published: (2025)
by: Huang, Kexin, et al.
Published: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
by: Gong, Yitian, et al.
Published: (2025)
by: Gong, Yitian, et al.
Published: (2025)
Agent Alignment in Evolving Social Norms
by: Li, Shimin, et al.
Published: (2024)
by: Li, Shimin, et al.
Published: (2024)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
by: Peng, Runyu, et al.
Published: (2026)
by: Peng, Runyu, et al.
Published: (2026)
How to Mitigate Overfitting in Weak-to-strong Generalization?
by: Shi, Junhao, et al.
Published: (2025)
by: Shi, Junhao, et al.
Published: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
by: Chen, Shimin, et al.
Published: (2024)
by: Chen, Shimin, et al.
Published: (2024)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
by: OpenMOSS Team, et al.
Published: (2026)
by: OpenMOSS Team, et al.
Published: (2026)
To Defer or To Shift? The Role of AI Data Center Flexibility on Grid Interconnection
by: Chen, Yize, et al.
Published: (2026)
by: Chen, Yize, et al.
Published: (2026)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
by: Wang, Siyin, et al.
Published: (2025)
by: Wang, Siyin, et al.
Published: (2025)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
by: Chen, Shimin, et al.
Published: (2024)
by: Chen, Shimin, et al.
Published: (2024)
Parameters self‐turning controller fused with an adaptive nominal model for disturbance observer: Application to direct drive manipulator with significant payload changes
by: Yang Liu, et al.
Published: (2024)
by: Yang Liu, et al.
Published: (2024)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
by: Wang, Yikun, et al.
Published: (2025)
by: Wang, Yikun, et al.
Published: (2025)
RAIRS: Optimizing Redundant Assignment and List Layout for IVF-Based ANN Search
by: Yang, Zehai, et al.
Published: (2026)
by: Yang, Zehai, et al.
Published: (2026)
LITS: An Optimized Learned Index for Strings (An Extended Version)
by: Yang, Yifan, et al.
Published: (2024)
by: Yang, Yifan, et al.
Published: (2024)
Largest $2$-regular Subgraphs in complete $S$-partite Graphs
by: Jiang, Yiyang, et al.
Published: (2026)
by: Jiang, Yiyang, et al.
Published: (2026)
Can AI Assistants Know What They Don't Know?
by: Cheng, Qinyuan, et al.
Published: (2024)
by: Cheng, Qinyuan, et al.
Published: (2024)
Do Deployment Constraints Make LLMs Hallucinate Citations? An Empirical Study across Four Models and Five Prompting Regimes
by: Zhao, Chen, et al.
Published: (2026)
by: Zhao, Chen, et al.
Published: (2026)
Pine Needles as ‘Knives’ Cutting Falling Raindrops: How Do Sharper Knives Cut Larger Raindrops?
by: Cheng Yang, et al.
Published: (2025)
by: Cheng Yang, et al.
Published: (2025)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
by: Wang, Siyin, et al.
Published: (2024)
by: Wang, Siyin, et al.
Published: (2024)
Optimal Confidence Band for Kernel Gradient Flow Estimator
by: Cheng, Yuqian, et al.
Published: (2026)
by: Cheng, Yuqian, et al.
Published: (2026)
SponTTS: modeling and transferring spontaneous style for TTS
by: Li, Hanzhao, et al.
Published: (2023)
by: Li, Hanzhao, et al.
Published: (2023)
Does Fiscal Efficiency Affect Green Total Factor Productivity: Evidence Based on Spatial Panel Data Models
by: Lei Jiang, et al.
Published: (2025)
by: Lei Jiang, et al.
Published: (2025)
Dual Ion Regulated Eutectogels with High Elasticity and Adhesive Strength for Accurate Strain Sensors
by: Yaozhou Sun, et al.
Published: (2024)
by: Yaozhou Sun, et al.
Published: (2024)
Downsampled tractography
by: Chen, Yuqian
Published: (2026)
by: Chen, Yuqian
Published: (2026)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
by: Xue, Heyang, et al.
Published: (2025)
by: Xue, Heyang, et al.
Published: (2025)
Design and Optimization of Gradient Foam Core Sandwich Structures With Superior Microwave Absorption Performance
by: Junzhen Chen, et al.
Published: (2025)
by: Junzhen Chen, et al.
Published: (2025)
Oligonucleotide‐Based Modulation of Macrophage Polarization: Emerging Strategies in Immunotherapy
by: Hanfu Zhang, et al.
Published: (2025)
by: Hanfu Zhang, et al.
Published: (2025)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
by: Zhan, Jun, et al.
Published: (2025)
by: Zhan, Jun, et al.
Published: (2025)
Extended Self-similarity in Multimode Optical Fiber Speckles
by: Wu, Mengxin, et al.
Published: (2026)
by: Wu, Mengxin, et al.
Published: (2026)
Glycoside Hydrolase Family 16 Enzyme RsEG146 From Rhizoctonia solani AG1 IA Induces Cell Death and Triggers Defence Response in Nicotiana tabacum
by: Chen Chen, et al.
Published: (2025)
by: Chen Chen, et al.
Published: (2025)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
by: Zhao, Yuxiang, et al.
Published: (2025)
by: Zhao, Yuxiang, et al.
Published: (2025)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
by: Zeng, Zhiyuan, et al.
Published: (2025)
by: Zeng, Zhiyuan, et al.
Published: (2025)
Similar Items
-
MOSS-TTSD: Text to Spoken Dialogue Generation
by: Zhang, Yuqian, et al.
Published: (2026) -
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
by: Gong, Yitian, et al.
Published: (2026) -
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
by: Huang, Kexin, et al.
Published: (2026) -
MOSS-Audio Technical Report
by: Yang, Chen, et al.
Published: (2026) -
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
by: Zhao, Xingjian, et al.
Published: (2025)