MOVA: Towards Scalable and Synchronized Video-Audio Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | OpenMOSS Team, Yu, Donghua, Chen, Mingshu, Chen, Qi, Luo, Qi, Wu, Qianyi, Cheng, Qinyuan, Li, Ruixiao, Liang, Tianyi, Zhang, Wenbo, Tu, Wenming, Peng, Xiangyu, Gao, Yang, Huo, Yanru, Zhu, Ying, Luo, Yinze, Zhang, Yiyang, Song, Yuerong, Xu, Zhe, Zhang, Zhiyu, Yang, Chenchen, Chang, Cheng, Zhou, Chushu, Chen, Hanfu, Ma, Hongnan, Li, Jiaxi, Tong, Jingqi, Liu, Junxi, Chen, Ke, Li, Shimin, Jiang, Shiqi, Wang, Songlin, Jiang, Wei, Fei, Zhaoye, Ning, Zhiyuan, Li, Chunguo, Li, Chenhui, He, Ziwei, Huang, Zengfeng, Chen, Xie, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MOSS-TTSD: Text to Spoken Dialogue Generation
von: Zhang, Yuqian, et al.
Veröffentlicht: (2026)
von: Zhang, Yuqian, et al.
Veröffentlicht: (2026)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
von: Zhao, Xingjian, et al.
Veröffentlicht: (2025)
von: Zhao, Xingjian, et al.
Veröffentlicht: (2025)
MOSS-TTS Technical Report
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
MOSS-Audio Technical Report
von: Yang, Chen, et al.
Veröffentlicht: (2026)
von: Yang, Chen, et al.
Veröffentlicht: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
MOSS Transcribe Diarize Technical Report
von: AI, MOSI., et al.
Veröffentlicht: (2026)
von: AI, MOSI., et al.
Veröffentlicht: (2026)
SWDL: Stratum-Wise Difference Learning with Deep Laplacian Pyramid for Semi-Supervised 3D Intracranial Hemorrhage Segmentation
von: Wang, Cheng, et al.
Veröffentlicht: (2025)
von: Wang, Cheng, et al.
Veröffentlicht: (2025)
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
von: Song, Yuerong, et al.
Veröffentlicht: (2025)
von: Song, Yuerong, et al.
Veröffentlicht: (2025)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
von: Peng, Runyu, et al.
Veröffentlicht: (2026)
von: Peng, Runyu, et al.
Veröffentlicht: (2026)
Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
von: Li, Ruixiao, et al.
Veröffentlicht: (2025)
von: Li, Ruixiao, et al.
Veröffentlicht: (2025)
Learning Recommender Systems with Soft Target: A Decoupled Perspective
von: Zhang, Hao, et al.
Veröffentlicht: (2024)
von: Zhang, Hao, et al.
Veröffentlicht: (2024)
X2-N: A Transformable Wheel-legged Humanoid Robot with Dual-mode Locomotion and Manipulation
von: Ning, Yan, et al.
Veröffentlicht: (2026)
von: Ning, Yan, et al.
Veröffentlicht: (2026)
Cosmogenic Neutrino Point Source and KM3-230213A
von: Zhang, Qinyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Qinyuan, et al.
Veröffentlicht: (2025)
On the length of an arithmetic progression of the form ${3^x+2^y}$
von: Chen, Hongnan, et al.
Veröffentlicht: (2024)
von: Chen, Hongnan, et al.
Veröffentlicht: (2024)
Oligonucleotide‐Based Modulation of Macrophage Polarization: Emerging Strategies in Immunotherapy
von: Hanfu Zhang, et al.
Veröffentlicht: (2025)
von: Hanfu Zhang, et al.
Veröffentlicht: (2025)
Universal Multi-view Black-box Attack against Object Detectors via Layout Optimization
von: Wang, Donghua, et al.
Veröffentlicht: (2024)
von: Wang, Donghua, et al.
Veröffentlicht: (2024)
Neural Tucker Convolutional Network for Water Quality Analysis
von: Si, Hongnan, et al.
Veröffentlicht: (2025)
von: Si, Hongnan, et al.
Veröffentlicht: (2025)
Improving Compiler Bug Isolation by Leveraging Large Language Models
von: Qi, Yixian, et al.
Veröffentlicht: (2025)
von: Qi, Yixian, et al.
Veröffentlicht: (2025)
WSCF-MVCC: Weakly-supervised Calibration-free Multi-view Crowd Counting
von: Li, Bin, et al.
Veröffentlicht: (2025)
von: Li, Bin, et al.
Veröffentlicht: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
von: Gong, Yitian, et al.
Veröffentlicht: (2025)
von: Gong, Yitian, et al.
Veröffentlicht: (2025)
Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
von: Luo, Zheheng, et al.
Veröffentlicht: (2024)
Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Tracking
von: Li, Chunjiang, et al.
Veröffentlicht: (2026)
von: Li, Chunjiang, et al.
Veröffentlicht: (2026)
Pre-trained Language Model and Knowledge Distillation for Lightweight Sequential Recommendation
von: Li, Li, et al.
Veröffentlicht: (2024)
von: Li, Li, et al.
Veröffentlicht: (2024)
Online Item Cold-Start Recommendation with Popularity-Aware Meta-Learning
von: Luo, Yunze, et al.
Veröffentlicht: (2024)
von: Luo, Yunze, et al.
Veröffentlicht: (2024)
Shear Capacity Calculation Methods for Reinforced Concrete Structure
von: Qi Li, et al.
Veröffentlicht: (2025)
von: Qi Li, et al.
Veröffentlicht: (2025)
Overall Ultra-high Energy Neutrino Emission from GRBs during Jet Expansion
von: Zhang, Qinyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Qinyuan, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Euclidean Data Augmentation for State-Based Continuous Control
von: Luo, Jinzhu, et al.
Veröffentlicht: (2024)
von: Luo, Jinzhu, et al.
Veröffentlicht: (2024)
FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
von: Tong, Chaodong, et al.
Veröffentlicht: (2026)
von: Tong, Chaodong, et al.
Veröffentlicht: (2026)
The Novel HLA‐DPB1*1156:01:02 Allele was Identified by Next‐Generation Sequencing
von: Chen Chen, et al.
Veröffentlicht: (2025)
von: Chen Chen, et al.
Veröffentlicht: (2025)
Forming Limits Prediction of Laminated SUS430/Al1050/SUS430 Composites and the Effect of Component Properties on Mechanical Performance
von: Xin Li, et al.
Veröffentlicht: (2024)
von: Xin Li, et al.
Veröffentlicht: (2024)
Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache
von: Liu, Xiaoran, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoran, et al.
Veröffentlicht: (2025)
NN-Based Joint Mitigation of IQ Imbalance and PA Nonlinearity With Multiple States
von: Zhang, Yundi, et al.
Veröffentlicht: (2025)
von: Zhang, Yundi, et al.
Veröffentlicht: (2025)
Research on Intellectual Property Right Problems of Peer-to-Peer Networks.
von: Dong, Ying, et al.
Veröffentlicht: (2002)
von: Dong, Ying, et al.
Veröffentlicht: (2002)
A Rapid Synthesis of Amorphous LiTaOCl4 Solid Electrolytes Through a Two‐Step Reaction Pathway for High‐Rate and Long‐Cycling Lithium Batteries
von: Lin Li, et al.
Veröffentlicht: (2024)
von: Lin Li, et al.
Veröffentlicht: (2024)
Discovery of New CDDO‐Imidazole Derivatives as Potential Antitumor Agents
von: Yanqing Li, et al.
Veröffentlicht: (2026)
von: Yanqing Li, et al.
Veröffentlicht: (2026)
SegAnyPET: Universal Promptable Segmentation from Positron Emission Tomography Images
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Secondary frequency control of islanded microgrid considering wind and solar stochastics
von: Zhong, Cheng, et al.
Veröffentlicht: (2023)
von: Zhong, Cheng, et al.
Veröffentlicht: (2023)
ESG Rating Disagreement and the Quality of Analysts' Forecasts: Information or Noise
von: Menghan Li, et al.
Veröffentlicht: (2024)
von: Menghan Li, et al.
Veröffentlicht: (2024)
ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling
von: Li, Daowen, et al.
Veröffentlicht: (2026)
von: Li, Daowen, et al.
Veröffentlicht: (2026)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MOSS-TTSD: Text to Spoken Dialogue Generation
von: Zhang, Yuqian, et al.
Veröffentlicht: (2026) -
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
von: Zhao, Xingjian, et al.
Veröffentlicht: (2025) -
MOSS-TTS Technical Report
von: Gong, Yitian, et al.
Veröffentlicht: (2026) -
MOSS-Audio Technical Report
von: Yang, Chen, et al.
Veröffentlicht: (2026) -
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
von: Gong, Yitian, et al.
Veröffentlicht: (2026)