Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Peiwen, Cheng, Sitong, Li, Xiangtai, Ye, Zhen, Liu, Huadai, Zhang, Honggang, Xue, Wei, Guo, Yike |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Inference-time Scaling for Diffusion-based Audio Super-resolution
par: Jin, Yizhu, et autres
Publié: (2025)
par: Jin, Yizhu, et autres
Publié: (2025)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
par: Ye, Zhen, et autres
Publié: (2024)
par: Ye, Zhen, et autres
Publié: (2024)
MEDIC: Zero-shot Music Editing with Disentangled Inversion Control
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
par: Wang, Yuanyuan, et autres
Publié: (2024)
par: Wang, Yuanyuan, et autres
Publié: (2024)
Can Large Language Models Understand Spatial Audio?
par: Tang, Changli, et autres
Publié: (2024)
par: Tang, Changli, et autres
Publié: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
Towards Spatial Audio Understanding via Question Answering
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
par: Li, Yangze, et autres
Publié: (2024)
par: Li, Yangze, et autres
Publié: (2024)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
ASAudio: A Survey of Advanced Spatial Audio Research
par: Zhu, Zhiyuan, et autres
Publié: (2025)
par: Zhu, Zhiyuan, et autres
Publié: (2025)
FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
par: Chen, Jianyi, et autres
Publié: (2024)
par: Chen, Jianyi, et autres
Publié: (2024)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
par: Hu, Jinbo, et autres
Publié: (2025)
par: Hu, Jinbo, et autres
Publié: (2025)
Universal Spatial Audio Transcoder
par: Sagasti, Amaia, et autres
Publié: (2024)
par: Sagasti, Amaia, et autres
Publié: (2024)
Exploring the Potential of Data-Driven Spatial Audio Enhancement Using a Single-Channel Model
par: Santos, Arthur N. dos, et autres
Publié: (2024)
par: Santos, Arthur N. dos, et autres
Publié: (2024)
Unlocking Large Audio-Language Models for Interactive Language Learning
par: Liu, Hongfu, et autres
Publié: (2026)
par: Liu, Hongfu, et autres
Publié: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Quantifying Spatial Audio Quality Impairment
par: Watcharasupat, Karn N., et autres
Publié: (2023)
par: Watcharasupat, Karn N., et autres
Publié: (2023)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
par: Coldenhoff, Jozef, et autres
Publié: (2024)
par: Coldenhoff, Jozef, et autres
Publié: (2024)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025)
par: Zhao, Jinzheng, et autres
Publié: (2025)
Natural Language Supervision for General-Purpose Audio Representations
par: Elizalde, Benjamin, et autres
Publié: (2023)
par: Elizalde, Benjamin, et autres
Publié: (2023)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
par: Ren, Yong, et autres
Publié: (2026)
par: Ren, Yong, et autres
Publié: (2026)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
par: Dinkel, Heinrich, et autres
Publié: (2025)
par: Dinkel, Heinrich, et autres
Publié: (2025)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
par: Shimada, Kazuki, et autres
Publié: (2024)
par: Shimada, Kazuki, et autres
Publié: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
par: Xiao, Feiyang, et autres
Publié: (2024)
par: Xiao, Feiyang, et autres
Publié: (2024)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
Past, Present, and Future of Spatial Audio and Room Acoustics
par: Koyama, Shoichi, et autres
Publié: (2025)
par: Koyama, Shoichi, et autres
Publié: (2025)
Documents similaires
-
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025) -
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024) -
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024) -
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2025) -
Inference-time Scaling for Diffusion-based Audio Super-resolution
par: Jin, Yizhu, et autres
Publié: (2025)