Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zixuan, Tang, Chi-Keung, Tai, Yu-Wing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
par: Hayakawa, Akio, et autres
Publié: (2025)
par: Hayakawa, Akio, et autres
Publié: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
par: Lin, Yan-Bo, et autres
Publié: (2025)
par: Lin, Yan-Bo, et autres
Publié: (2025)
AudioX: A Unified Framework for Anything-to-Audio Generation
par: Tian, Zeyue, et autres
Publié: (2025)
par: Tian, Zeyue, et autres
Publié: (2025)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
par: Malard, Hugo, et autres
Publié: (2024)
par: Malard, Hugo, et autres
Publié: (2024)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
par: Su, Kun, et autres
Publié: (2024)
par: Su, Kun, et autres
Publié: (2024)
Exploring Federated Self-Supervised Learning for General Purpose Audio Understanding
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2024)
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2024)
Exploring Green AI for Audio Deepfake Detection
par: Saha, Subhajit, et autres
Publié: (2024)
par: Saha, Subhajit, et autres
Publié: (2024)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
par: Haji-Ali, Moayed, et autres
Publié: (2024)
par: Haji-Ali, Moayed, et autres
Publié: (2024)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
par: Li, Tingle, et autres
Publié: (2025)
par: Li, Tingle, et autres
Publié: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
Dynamic Cross Attention for Audio-Visual Person Verification
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
Characterizing Continual Learning Scenarios and Strategies for Audio Analysis
par: Bhatt, Ruchi, et autres
Publié: (2024)
par: Bhatt, Ruchi, et autres
Publié: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
par: Cheng, Luyao, et autres
Publié: (2024)
par: Cheng, Luyao, et autres
Publié: (2024)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
par: Fang, Pengjun, et autres
Publié: (2026)
par: Fang, Pengjun, et autres
Publié: (2026)
Audio-visual video-to-speech synthesis with synthesized input audio
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
par: Kefalas, Triantafyllos, et autres
Publié: (2023)
Audio-Visual Instance Segmentation
par: Guo, Ruohao, et autres
Publié: (2023)
par: Guo, Ruohao, et autres
Publié: (2023)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
par: Takahashi, Akira, et autres
Publié: (2025)
par: Takahashi, Akira, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation
par: Zeng, Runhao, et autres
Publié: (2025)
par: Zeng, Runhao, et autres
Publié: (2025)
Audio-visual Generalized Zero-shot Learning the Easy Way
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
par: Li, Tingle, et autres
Publié: (2024)
par: Li, Tingle, et autres
Publié: (2024)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
par: Cheng, Ho Kei, et autres
Publié: (2024)
par: Cheng, Ho Kei, et autres
Publié: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
par: Lee, Junwon, et autres
Publié: (2025)
par: Lee, Junwon, et autres
Publié: (2025)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
par: Marinoni, Christian, et autres
Publié: (2025)
par: Marinoni, Christian, et autres
Publié: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
par: Yang, Shiqi, et autres
Publié: (2024)
par: Yang, Shiqi, et autres
Publié: (2024)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
SONNET: Enhancing Time Delay Estimation by Leveraging Simulated Audio
par: Tegler, Erik, et autres
Publié: (2024)
par: Tegler, Erik, et autres
Publié: (2024)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
Sequential Contrastive Audio-Visual Learning
par: Tsiamas, Ioannis, et autres
Publié: (2024)
par: Tsiamas, Ioannis, et autres
Publié: (2024)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
Semantic Grouping Network for Audio Source Separation
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
par: Wang, Yaoting, et autres
Publié: (2023)
par: Wang, Yaoting, et autres
Publié: (2023)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
Documents similaires
-
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
par: Hayakawa, Akio, et autres
Publié: (2025) -
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
par: Lin, Yan-Bo, et autres
Publié: (2025) -
AudioX: A Unified Framework for Anything-to-Audio Generation
par: Tian, Zeyue, et autres
Publié: (2025) -
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
par: Malard, Hugo, et autres
Publié: (2024) -
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
par: Wang, Zixuan, et autres
Publié: (2024)