UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Dongchao, Wang, Yuanyuan, Chong, Dading, Liu, Songxiang, Wu, Xixin, Meng, Helen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
por: Yang, Dongchao, et al.
Publicado: (2025)
por: Yang, Dongchao, et al.
Publicado: (2025)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
UniSep: Universal Target Audio Separation with Language Models at Scale
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
por: Yan, Canxiang, et al.
Publicado: (2025)
por: Yan, Canxiang, et al.
Publicado: (2025)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
por: Wang, Yuanyuan, et al.
Publicado: (2026)
por: Wang, Yuanyuan, et al.
Publicado: (2026)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
por: Xu, Xuenan, et al.
Publicado: (2025)
por: Xu, Xuenan, et al.
Publicado: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
por: Yang, Dongchao, et al.
Publicado: (2025)
por: Yang, Dongchao, et al.
Publicado: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
por: Mei, Jiahao, et al.
Publicado: (2026)
por: Mei, Jiahao, et al.
Publicado: (2026)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
por: Tao, Ye, et al.
Publicado: (2025)
por: Tao, Ye, et al.
Publicado: (2025)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
por: Jiang, Yidi, et al.
Publicado: (2025)
por: Jiang, Yidi, et al.
Publicado: (2025)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
por: Chen, Wei-Chih, et al.
Publicado: (2026)
por: Chen, Wei-Chih, et al.
Publicado: (2026)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
por: Liao, Huan, et al.
Publicado: (2024)
por: Liao, Huan, et al.
Publicado: (2024)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
por: Bensaid, Reda, et al.
Publicado: (2026)
por: Bensaid, Reda, et al.
Publicado: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
por: Wang, Yuxuan, et al.
Publicado: (2026)
por: Wang, Yuxuan, et al.
Publicado: (2026)
Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
por: Wang, Yanyun, et al.
Publicado: (2026)
por: Wang, Yanyun, et al.
Publicado: (2026)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
por: Glazer, Neta, et al.
Publicado: (2026)
por: Glazer, Neta, et al.
Publicado: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
por: Chen, William, et al.
Publicado: (2026)
por: Chen, William, et al.
Publicado: (2026)
WAKE: Watermarking Audio with Key Enrichment
por: Xu, Yaoxun, et al.
Publicado: (2025)
por: Xu, Yaoxun, et al.
Publicado: (2025)
Ejemplares similares
-
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023) -
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024) -
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
por: Yang, Dongchao, et al.
Publicado: (2025) -
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024) -
UniSep: Universal Target Audio Separation with Language Models at Scale
por: Wang, Yuanyuan, et al.
Publicado: (2025)