AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuanyuan, Chen, Hangting, Yang, Dongchao, Wu, Zhiyong, Wu, Xixin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniSep: Universal Target Audio Separation with Language Models at Scale
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
por: Wang, Yuanyuan, et al.
Publicado: (2026)
por: Wang, Yuanyuan, et al.
Publicado: (2026)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
WAKE: Watermarking Audio with Key Enrichment
por: Xu, Yaoxun, et al.
Publicado: (2025)
por: Xu, Yaoxun, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
por: Chen, Xueyuan, et al.
Publicado: (2025)
por: Chen, Xueyuan, et al.
Publicado: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
por: Chen, Yushen, et al.
Publicado: (2025)
por: Chen, Yushen, et al.
Publicado: (2025)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
por: Wu, Shih-Lun, et al.
Publicado: (2023)
por: Wu, Shih-Lun, et al.
Publicado: (2023)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023)
por: Elizalde, Benjamin, et al.
Publicado: (2023)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
por: Zheng, Zihao, et al.
Publicado: (2025)
por: Zheng, Zihao, et al.
Publicado: (2025)
Streaming Audio Transformers for Online Audio Tagging
por: Dinkel, Heinrich, et al.
Publicado: (2023)
por: Dinkel, Heinrich, et al.
Publicado: (2023)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
por: Wang, Zehan, et al.
Publicado: (2025)
por: Wang, Zehan, et al.
Publicado: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
Towards Weakly Supervised Text-to-Audio Grounding
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
por: Salganik, Rebecca, et al.
Publicado: (2026)
por: Salganik, Rebecca, et al.
Publicado: (2026)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Unsupervised Composable Representations for Audio
por: Bindi, Giovanni, et al.
Publicado: (2024)
por: Bindi, Giovanni, et al.
Publicado: (2024)
FLAM: Frame-Wise Language-Audio Modeling
por: Wu, Yusong, et al.
Publicado: (2025)
por: Wu, Yusong, et al.
Publicado: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
por: Hu, Jinbo, et al.
Publicado: (2025)
por: Hu, Jinbo, et al.
Publicado: (2025)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
por: Xu, Xuenan, et al.
Publicado: (2023)
por: Xu, Xuenan, et al.
Publicado: (2023)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Ejemplares similares
-
UniSep: Universal Target Audio Separation with Language Models at Scale
por: Wang, Yuanyuan, et al.
Publicado: (2025) -
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025) -
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
por: Wang, Yuanyuan, et al.
Publicado: (2026) -
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024) -
WAKE: Watermarking Audio with Key Enrichment
por: Xu, Yaoxun, et al.
Publicado: (2025)