AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, William, Seetharaman, Prem, Kumar, Rithesh, Nieto, Oriol, Watanabe, Shinji, Salamon, Justin, Jin, Zeyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
TAC: Timestamped Audio Captioning
di: Kumar, Sonal, et al.
Pubblicazione: (2026)
di: Kumar, Sonal, et al.
Pubblicazione: (2026)
Audiocards: Structured Metadata Improves Audio Language Models For Sound Design
di: Sridhar, Sripathi, et al.
Pubblicazione: (2026)
di: Sridhar, Sripathi, et al.
Pubblicazione: (2026)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025)
di: Wen, Yutong, et al.
Pubblicazione: (2025)
Taming Audio VAEs via Target-KL Regularization
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
FLAM: Frame-Wise Language-Audio Modeling
di: Wu, Yusong, et al.
Pubblicazione: (2025)
di: Wu, Yusong, et al.
Pubblicazione: (2025)
Mix2Morph: Learning Sound Morphing from Noisy Mixes
di: Chu, Annie, et al.
Pubblicazione: (2026)
di: Chu, Annie, et al.
Pubblicazione: (2026)
Code Drift: Towards Idempotent Neural Audio Codecs
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
Augment, Drop & Swap: Improving Diversity in LLM Captions for Efficient Music-Text Representation Learning
di: Manco, Ilaria, et al.
Pubblicazione: (2024)
di: Manco, Ilaria, et al.
Pubblicazione: (2024)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
di: Tao, Ye, et al.
Pubblicazione: (2025)
di: Tao, Ye, et al.
Pubblicazione: (2025)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
YODAS: Youtube-Oriented Dataset for Audio and Speech
di: Li, Xinjian, et al.
Pubblicazione: (2024)
di: Li, Xinjian, et al.
Pubblicazione: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
di: Sakshi, S, et al.
Pubblicazione: (2024)
di: Sakshi, S, et al.
Pubblicazione: (2024)
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
di: Li, Yingahao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yingahao Aaron, et al.
Pubblicazione: (2024)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
di: Xie, Zeyu, et al.
Pubblicazione: (2026)
di: Xie, Zeyu, et al.
Pubblicazione: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
di: Yan, Canxiang, et al.
Pubblicazione: (2025)
di: Yan, Canxiang, et al.
Pubblicazione: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
Virtual Consistency for Audio Editing
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
di: Udupa, Sathvik, et al.
Pubblicazione: (2025)
di: Udupa, Sathvik, et al.
Pubblicazione: (2025)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
HEAR: Holistic Evaluation of Audio Representations
di: Turian, Joseph, et al.
Pubblicazione: (2022)
di: Turian, Joseph, et al.
Pubblicazione: (2022)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
di: Hu, Jinbo, et al.
Pubblicazione: (2025)
di: Hu, Jinbo, et al.
Pubblicazione: (2025)
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026)
di: Zhu, Haina, et al.
Pubblicazione: (2026)
Unified Audio Event Detection
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
di: Gao, Liting, et al.
Pubblicazione: (2025)
di: Gao, Liting, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026) -
TAC: Timestamped Audio Captioning
di: Kumar, Sonal, et al.
Pubblicazione: (2026) -
Audiocards: Structured Metadata Improves Audio Language Models For Sound Design
di: Sridhar, Sripathi, et al.
Pubblicazione: (2026) -
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024) -
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025)