Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
Fuente:
arXiv
Saved in:
| Main Authors: | Yan, Canxiang, Jin, Chunxiang, Huang, Dawei, Yu, Haibing, Peng, Han, Zhan, Hui, Gao, Jie, Peng, Jing, Chen, Jingdong, Zhou, Jun, Ren, Kaimeng, Yang, Ming, Yang, Mingxue, Xu, Qiang, Zhao, Qin, Xiong, Ruijie, Lin, Shaoxiong, Wang, Xuezhi, Yuan, Yi, Wu, Yifei, Lyu, Yongjie, He, Zhengyu, Qiu, Zhihao, Fang, Zhiqiang, Huang, Ziyuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
by: Yang, Dongchao, et al.
Published: (2023)
by: Yang, Dongchao, et al.
Published: (2023)
When Tone and Words Disagree: Towards Robust Speech Emotion Recognition under Acoustic-Semantic Conflict
by: Huang, Dawei, et al.
Published: (2026)
by: Huang, Dawei, et al.
Published: (2026)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
by: Huang, Ziyuan, et al.
Published: (2025)
by: Huang, Ziyuan, et al.
Published: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
by: Yang, Dongchao, et al.
Published: (2024)
by: Yang, Dongchao, et al.
Published: (2024)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
by: Yang, Dongchao, et al.
Published: (2026)
by: Yang, Dongchao, et al.
Published: (2026)
VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis
by: Ma, Chengyuan, et al.
Published: (2026)
by: Ma, Chengyuan, et al.
Published: (2026)
Ming-Omni: A Unified Multimodal Model for Perception and Generation
by: AI, Inclusion, et al.
Published: (2025)
by: AI, Inclusion, et al.
Published: (2025)
Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
by: AI, Inclusion, et al.
Published: (2025)
by: AI, Inclusion, et al.
Published: (2025)
Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction
by: AI, Inclusion, et al.
Published: (2025)
by: AI, Inclusion, et al.
Published: (2025)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
by: Chu, Xuangeng, et al.
Published: (2025)
by: Chu, Xuangeng, et al.
Published: (2025)
AudioScenic: Audio-Driven Video Scene Editing
by: Shen, Kaixin, et al.
Published: (2024)
by: Shen, Kaixin, et al.
Published: (2024)
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
by: Jiang, Hong, et al.
Published: (2026)
by: Jiang, Hong, et al.
Published: (2026)
Enhancing Deepfake Audio Detection: A ResNet Framework Based on Hybrid Features and Self‐Attention Mechanism
by: Lian Huang, et al.
Published: (2025)
by: Lian Huang, et al.
Published: (2025)
Vignettes from the Late Ming
by: Ye, Yang
Published: (2023)
by: Ye, Yang
Published: (2023)
Political incentives and corporate income tax: Evidence from China
by: Chunxiang Zhao, et al.
Published: (2024)
by: Chunxiang Zhao, et al.
Published: (2024)
SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos
by: Huang, Xiyang, et al.
Published: (2026)
by: Huang, Xiyang, et al.
Published: (2026)
The evolution of commercial finance in Ming-Qing China: 16th to Early-20th Centuries
by: Kaixiang Peng
Published: (2023)
by: Kaixiang Peng
Published: (2023)
F2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling
by: Yue, Huanjing, et al.
Published: (2026)
by: Yue, Huanjing, et al.
Published: (2026)
UniField: A Unified Field-Aware MRI Enhancement Framework
by: Lin, Yiyang, et al.
Published: (2026)
by: Lin, Yiyang, et al.
Published: (2026)
Enhancing Clinical Text Classification via Fine-Tuned DRAGON Longformer Models
by: Yang, Mingchuan, et al.
Published: (2025)
by: Yang, Mingchuan, et al.
Published: (2025)
Trans‐gender things: Objects and the materiality of trans‐femininity in Ming‐Qing China
by: Aixia Huang
Published: (2024)
by: Aixia Huang
Published: (2024)
Feedback Intensity Equalization Algorithm for Multi-Spots Holographic Tweezer
by: Wang, Shaoxiong, et al.
Published: (2024)
by: Wang, Shaoxiong, et al.
Published: (2024)
The Ming Dynasty
by: Hucker, Charles O.
Published: (2020)
by: Hucker, Charles O.
Published: (2020)
Ming Zhao
by: Ming Zhao
Published: (2025)
by: Ming Zhao
Published: (2025)
Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models
by: Liu, Dingning, et al.
Published: (2024)
by: Liu, Dingning, et al.
Published: (2024)
Masked Audio Modeling with CLAP and Multi-Objective Learning
by: Xin, Yifei, et al.
Published: (2024)
by: Xin, Yifei, et al.
Published: (2024)
Returning to Shannon's Original Meaning
by: Yang, Xuezhi
Published: (2019)
by: Yang, Xuezhi
Published: (2019)
Solving the Problem of Induction
by: Yang, Xuezhi
Published: (2023)
by: Yang, Xuezhi
Published: (2023)
M&M VTO: Multi-Garment Virtual Try-On and Editing
by: Zhu, Luyang, et al.
Published: (2024)
by: Zhu, Luyang, et al.
Published: (2024)
Cascaded Code Editing: Large-Small Model Collaboration for Effective and Efficient Code Editing
by: Wang, Chaozheng, et al.
Published: (2026)
by: Wang, Chaozheng, et al.
Published: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
by: Tian, Zeyue, et al.
Published: (2026)
by: Tian, Zeyue, et al.
Published: (2026)
Unified Audio Event Detection
by: Jiang, Yidi, et al.
Published: (2024)
by: Jiang, Yidi, et al.
Published: (2024)
UniEdit-Flow: Unleashing Inversion and Editing in the Era of Flow Models
by: Jiao, Guanlong, et al.
Published: (2025)
by: Jiao, Guanlong, et al.
Published: (2025)
UniMesh: Unifying 3D Mesh Understanding and Generation
by: Huang, Peng, et al.
Published: (2026)
by: Huang, Peng, et al.
Published: (2026)
Insert Anything: Image Insertion via In-Context Editing in DiT
by: Song, Wensong, et al.
Published: (2025)
by: Song, Wensong, et al.
Published: (2025)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
by: Xue, Jun, et al.
Published: (2026)
by: Xue, Jun, et al.
Published: (2026)
Predicting LLM Compression Degradation from Spectral Statistics
by: Xu, Mingxue
Published: (2026)
by: Xu, Mingxue
Published: (2026)
SeedEdit: Align Image Re-Generation to Image Editing
by: Shi, Yichun, et al.
Published: (2024)
by: Shi, Yichun, et al.
Published: (2024)
The Transformation of Yunnan in Ming China
Published: (2021)
Published: (2021)
Two Studies on Ming History
by: Hucker, Charles O.
Published: (2020)
by: Hucker, Charles O.
Published: (2020)
Similar Items
-
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
by: Yang, Dongchao, et al.
Published: (2023) -
When Tone and Words Disagree: Towards Robust Speech Emotion Recognition under Acoustic-Semantic Conflict
by: Huang, Dawei, et al.
Published: (2026) -
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
by: Huang, Ziyuan, et al.
Published: (2025) -
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
by: Yang, Dongchao, et al.
Published: (2024) -
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
by: Yang, Dongchao, et al.
Published: (2026)