MOSS Transcribe Diarize Technical Report
Fuente:
arXiv
Guardado en:
| Autores principales: | AI, MOSI., :, Yu, Donghua, Lin, Zhengyuan, Yang, Chen, Zhang, Yiyang, Chen, Hanfu, Chen, Jingqi, Chen, Ke, Fan, Liwei, Jiang, Yi, Zhu, Jie, Li, Muchen, Wang, Wenxuan, Wang, Yang, Xu, Zhe, Gong, Yitian, Zhang, Yuqian, Zhang, Wenbo, Wang, Songlin, Wu, Zhiyu, Fei, Zhaoye, Cheng, Qinyuan, Li, Shimin, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MOSS-TTSD: Text to Spoken Dialogue Generation
por: Zhang, Yuqian, et al.
Publicado: (2026)
por: Zhang, Yuqian, et al.
Publicado: (2026)
MOSS-Audio Technical Report
por: Yang, Chen, et al.
Publicado: (2026)
por: Yang, Chen, et al.
Publicado: (2026)
MOSS-TTS Technical Report
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
por: Zhao, Xingjian, et al.
Publicado: (2025)
por: Zhao, Xingjian, et al.
Publicado: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
por: Huang, Kexin, et al.
Publicado: (2025)
por: Huang, Kexin, et al.
Publicado: (2025)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
por: Deng, Ruifan, et al.
Publicado: (2025)
por: Deng, Ruifan, et al.
Publicado: (2025)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
por: Yang, Chenchen, et al.
Publicado: (2026)
por: Yang, Chenchen, et al.
Publicado: (2026)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
por: OpenMOSS Team, et al.
Publicado: (2026)
por: OpenMOSS Team, et al.
Publicado: (2026)
Agent Alignment in Evolving Social Norms
por: Li, Shimin, et al.
Publicado: (2024)
por: Li, Shimin, et al.
Publicado: (2024)
Design Strategies for Laser Additive Manufacturing of High‐Performance Alloys With Uniform Mechanical Properties
por: Jingqi Zhang, et al.
Publicado: (2026)
por: Jingqi Zhang, et al.
Publicado: (2026)
How to Mitigate Overfitting in Weak-to-strong Generalization?
por: Shi, Junhao, et al.
Publicado: (2025)
por: Shi, Junhao, et al.
Publicado: (2025)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
por: Wang, Yikun, et al.
Publicado: (2025)
por: Wang, Yikun, et al.
Publicado: (2025)
Unsupervised Multi-modal Feature Alignment for Time Series Representation Learning
por: Liang, Chen, et al.
Publicado: (2023)
por: Liang, Chen, et al.
Publicado: (2023)
SWDL: Stratum-Wise Difference Learning with Deep Laplacian Pyramid for Semi-Supervised 3D Intracranial Hemorrhage Segmentation
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
por: Cheng, Luyao, et al.
Publicado: (2023)
por: Cheng, Luyao, et al.
Publicado: (2023)
Revisiting Data Analysis with Pre-trained Foundation Models
por: Liang, Chen, et al.
Publicado: (2025)
por: Liang, Chen, et al.
Publicado: (2025)
Exploring Speaker Diarization with Mixture of Experts
por: Yang, Gaobin, et al.
Publicado: (2025)
por: Yang, Gaobin, et al.
Publicado: (2025)
Joint Beamforming and Position Design for Movable Antenna Assisted LEO ISAC Systems
por: Zhang, Hanfu, et al.
Publicado: (2025)
por: Zhang, Hanfu, et al.
Publicado: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
MOSS: A Large-scale Open Microscopic Traffic Simulation System
por: Zhang, Jun, et al.
Publicado: (2024)
por: Zhang, Jun, et al.
Publicado: (2024)
Can AI Assistants Know What They Don't Know?
por: Cheng, Qinyuan, et al.
Publicado: (2024)
por: Cheng, Qinyuan, et al.
Publicado: (2024)
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
por: Cheng, Luyao, et al.
Publicado: (2024)
por: Cheng, Luyao, et al.
Publicado: (2024)
RAIRS: Optimizing Redundant Assignment and List Layout for IVF-Based ANN Search
por: Yang, Zehai, et al.
Publicado: (2026)
por: Yang, Zehai, et al.
Publicado: (2026)
LITS: An Optimized Learned Index for Strings (An Extended Version)
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
por: Yang, Mu, et al.
Publicado: (2023)
por: Yang, Mu, et al.
Publicado: (2023)
Semi-supervised linear regression: enhancing efficiency and robustness in high dimensions
por: Chen, Kai, et al.
Publicado: (2023)
por: Chen, Kai, et al.
Publicado: (2023)
Balancing utility and cost in dynamic treatment regimes
por: Chen, Kai, et al.
Publicado: (2025)
por: Chen, Kai, et al.
Publicado: (2025)
The Effect of Income Polarization on Crime: Evidence From Court Judicial Documents in China
por: Jingqi Liu, et al.
Publicado: (2025)
por: Jingqi Liu, et al.
Publicado: (2025)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
por: Wang, Siyin, et al.
Publicado: (2024)
por: Wang, Siyin, et al.
Publicado: (2024)
SNR Maximization and Localization for UAV-IRS-Assisted Near-Field Systems
por: Zhang, Hanfu, et al.
Publicado: (2024)
por: Zhang, Hanfu, et al.
Publicado: (2024)
3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization
por: Chen, Yafeng, et al.
Publicado: (2024)
por: Chen, Yafeng, et al.
Publicado: (2024)
Class-aware and Augmentation-free Contrastive Learning from Label Proportion
por: Wang, Jialiang, et al.
Publicado: (2024)
por: Wang, Jialiang, et al.
Publicado: (2024)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
por: Chen, Ruitao, et al.
Publicado: (2024)
por: Chen, Ruitao, et al.
Publicado: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
On an approach to canonicalizing elliptic Feynman integrals
por: Chen, Jiaqi, et al.
Publicado: (2025)
por: Chen, Jiaqi, et al.
Publicado: (2025)
Ejemplares similares
-
MOSS-TTSD: Text to Spoken Dialogue Generation
por: Zhang, Yuqian, et al.
Publicado: (2026) -
MOSS-Audio Technical Report
por: Yang, Chen, et al.
Publicado: (2026) -
MOSS-TTS Technical Report
por: Gong, Yitian, et al.
Publicado: (2026) -
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
por: Zhao, Xingjian, et al.
Publicado: (2025) -
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)