Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wang, Junnuo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
CAFA: a Controllable Automatic Foley Artist
par: Benita, Roi, et autres
Publié: (2025)
par: Benita, Roi, et autres
Publié: (2025)
MambaFoley: Foley Sound Generation using Selective State-Space Models
par: Colombo, Marco Furio, et autres
Publié: (2024)
par: Colombo, Marco Furio, et autres
Publié: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
Post-Training Quantization for Audio Diffusion Transformers
par: Khandelwal, Tanmay, et autres
Publié: (2025)
par: Khandelwal, Tanmay, et autres
Publié: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024)
par: Tal, Or, et autres
Publié: (2024)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
par: Zhang, Yaoyun, et autres
Publié: (2024)
par: Zhang, Yaoyun, et autres
Publié: (2024)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
par: Gu, Yi, et autres
Publié: (2026)
par: Gu, Yi, et autres
Publié: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
par: García, Hugo Flores, et autres
Publié: (2024)
par: García, Hugo Flores, et autres
Publié: (2024)
BWSNet: Automatic Perceptual Assessment of Audio Signals
par: Veillon, Clément Le Moine, et autres
Publié: (2023)
par: Veillon, Clément Le Moine, et autres
Publié: (2023)
Online Single-Channel Audio-Based Sound Speed Estimation for Robust Multi-Channel Audio Control
par: Fuglsig, Andreas Jonas, et autres
Publié: (2026)
par: Fuglsig, Andreas Jonas, et autres
Publié: (2026)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
par: Khodzhaev, Zulfidin
Publié: (2024)
par: Khodzhaev, Zulfidin
Publié: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
Diffusion-Based Audio Inpainting
par: Moliner, Eloi, et autres
Publié: (2023)
par: Moliner, Eloi, et autres
Publié: (2023)
An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
par: da Costa, Maurício do V. M., et autres
Publié: (2025)
par: da Costa, Maurício do V. M., et autres
Publié: (2025)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
par: Yu, Fan, et autres
Publié: (2025)
par: Yu, Fan, et autres
Publié: (2025)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
par: Xie, Yadong, et autres
Publié: (2025)
par: Xie, Yadong, et autres
Publié: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
FAST: Fast Audio Spectrogram Transformer
par: Naman, Anugunj, et autres
Publié: (2025)
par: Naman, Anugunj, et autres
Publié: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
par: Wang, Mengqi, et autres
Publié: (2025)
par: Wang, Mengqi, et autres
Publié: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
par: Shi, Runwu, et autres
Publié: (2025)
par: Shi, Runwu, et autres
Publié: (2025)
T-FOLEY: A Controllable Waveform-Domain Diffusion Model for Temporal-Event-Guided Foley Sound Synthesis
par: Chung, Yoonjin, et autres
Publié: (2024)
par: Chung, Yoonjin, et autres
Publié: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
par: Rouard, Simon, et autres
Publié: (2024)
par: Rouard, Simon, et autres
Publié: (2024)
Fast Timing-Conditioned Latent Audio Diffusion
par: Evans, Zach, et autres
Publié: (2024)
par: Evans, Zach, et autres
Publié: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
par: Niu, Rui, et autres
Publié: (2025)
par: Niu, Rui, et autres
Publié: (2025)
AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences
par: Kishi, Minoru, et autres
Publié: (2025)
par: Kishi, Minoru, et autres
Publié: (2025)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
par: Comunità, Marco, et autres
Publié: (2024)
par: Comunità, Marco, et autres
Publié: (2024)
Lightweight Implicit Neural Network for Binaural Audio Synthesis
par: Lu, Xikun, et autres
Publié: (2025)
par: Lu, Xikun, et autres
Publié: (2025)
Documents similaires
-
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024) -
CAFA: a Controllable Automatic Foley Artist
par: Benita, Roi, et autres
Publié: (2025) -
MambaFoley: Foley Sound Generation using Selective State-Space Models
par: Colombo, Marco Furio, et autres
Publié: (2024) -
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025) -
FoleyBench: A Benchmark For Video-to-Audio Models
par: Dixit, Satvik, et autres
Publié: (2025)