SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Comunità, Marco, Zhong, Zhi, Takahashi, Akira, Yang, Shiqi, Zhao, Mengjie, Saito, Koichi, Ikemiya, Yukara, Shibuya, Takashi, Takahashi, Shusuke, Mitsufuji, Yuki |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
von: Chen, Yuanhong, et al.
Veröffentlicht: (2025)
von: Chen, Yuanhong, et al.
Veröffentlicht: (2025)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
von: Shimada, Kazuki, et al.
Veröffentlicht: (2024)
von: Shimada, Kazuki, et al.
Veröffentlicht: (2024)
Do Foundational Audio Encoders Understand Music Structure?
von: Toyama, Keisuke, et al.
Veröffentlicht: (2025)
von: Toyama, Keisuke, et al.
Veröffentlicht: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
von: Yang, Shiqi, et al.
Veröffentlicht: (2024)
von: Yang, Shiqi, et al.
Veröffentlicht: (2024)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
von: Zhong, Zhi, et al.
Veröffentlicht: (2025)
von: Zhong, Zhi, et al.
Veröffentlicht: (2025)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
von: Takahashi, Akira, et al.
Veröffentlicht: (2025)
von: Takahashi, Akira, et al.
Veröffentlicht: (2025)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
von: Nishigori, Shuichiro, et al.
Veröffentlicht: (2025)
von: Nishigori, Shuichiro, et al.
Veröffentlicht: (2025)
Zero- and Few-shot Sound Event Localization and Detection
von: Shimada, Kazuki, et al.
Veröffentlicht: (2023)
von: Shimada, Kazuki, et al.
Veröffentlicht: (2023)
FoleyBench: A Benchmark For Video-to-Audio Models
von: Dixit, Satvik, et al.
Veröffentlicht: (2025)
von: Dixit, Satvik, et al.
Veröffentlicht: (2025)
The Whole Is Greater than the Sum of Its Parts: Improving Music Source Separation by Bridging Network
von: Sawata, Ryosuke, et al.
Veröffentlicht: (2023)
von: Sawata, Ryosuke, et al.
Veröffentlicht: (2023)
SoundReactor: Frame-level Online Video-to-Audio Generation
von: Saito, Koichi, et al.
Veröffentlicht: (2025)
von: Saito, Koichi, et al.
Veröffentlicht: (2025)
Variable Bitrate Residual Vector Quantization for Audio Coding
von: Chae, Yunkee, et al.
Veröffentlicht: (2024)
von: Chae, Yunkee, et al.
Veröffentlicht: (2024)
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
von: Hayakawa, Akio, et al.
Veröffentlicht: (2025)
von: Hayakawa, Akio, et al.
Veröffentlicht: (2025)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
von: Takahashi, Akira, et al.
Veröffentlicht: (2026)
von: Takahashi, Akira, et al.
Veröffentlicht: (2026)
A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
von: Ishii, Masato, et al.
Veröffentlicht: (2024)
von: Ishii, Masato, et al.
Veröffentlicht: (2024)
SilentCipher: Deep Audio Watermarking
von: Singh, Mayank Kumar, et al.
Veröffentlicht: (2024)
von: Singh, Mayank Kumar, et al.
Veröffentlicht: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
von: Hirano, Masato, et al.
Veröffentlicht: (2023)
von: Hirano, Masato, et al.
Veröffentlicht: (2023)
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
von: Shi, Hao, et al.
Veröffentlicht: (2023)
von: Shi, Hao, et al.
Veröffentlicht: (2023)
ASM: Audio Spectrogram Mixer
von: Ji, Qingfeng, et al.
Veröffentlicht: (2024)
von: Ji, Qingfeng, et al.
Veröffentlicht: (2024)
BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network
von: Shibuya, Takashi, et al.
Veröffentlicht: (2023)
von: Shibuya, Takashi, et al.
Veröffentlicht: (2023)
SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation
von: Saito, Koichi, et al.
Veröffentlicht: (2024)
von: Saito, Koichi, et al.
Veröffentlicht: (2024)
Differentiable Black-box and Gray-box Modeling of Nonlinear Audio Effects
von: Comunità, Marco, et al.
Veröffentlicht: (2025)
von: Comunità, Marco, et al.
Veröffentlicht: (2025)
FAST: Fast Audio Spectrogram Transformer
von: Naman, Anugunj, et al.
Veröffentlicht: (2025)
von: Naman, Anugunj, et al.
Veröffentlicht: (2025)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
von: Hayakawa, Akio, et al.
Veröffentlicht: (2024)
von: Hayakawa, Akio, et al.
Veröffentlicht: (2024)
OpenMU: Your Swiss Army Knife for Music Understanding
von: Zhao, Mengjie, et al.
Veröffentlicht: (2024)
von: Zhao, Mengjie, et al.
Veröffentlicht: (2024)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
von: Araz, R. Oguz, et al.
Veröffentlicht: (2025)
von: Araz, R. Oguz, et al.
Veröffentlicht: (2025)
Masked Audio Modeling with CLAP and Multi-Objective Learning
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
Large-Scale Training Data Attribution for Music Generative Models via Unlearning
von: Choi, Woosung, et al.
Veröffentlicht: (2025)
von: Choi, Woosung, et al.
Veröffentlicht: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
von: Dixit, Satvik, et al.
Veröffentlicht: (2024)
von: Dixit, Satvik, et al.
Veröffentlicht: (2024)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
von: Khodzhaev, Zulfidin
Veröffentlicht: (2024)
von: Khodzhaev, Zulfidin
Veröffentlicht: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
von: Selvaraj, Nithish Muthuchamy, et al.
Veröffentlicht: (2023)
von: Selvaraj, Nithish Muthuchamy, et al.
Veröffentlicht: (2023)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
von: O'Reilly, Patrick, et al.
Veröffentlicht: (2025)
von: O'Reilly, Patrick, et al.
Veröffentlicht: (2025)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
von: Chaudhuri, Yashwardhan, et al.
Veröffentlicht: (2024)
von: Chaudhuri, Yashwardhan, et al.
Veröffentlicht: (2024)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
von: Cheng, Ho Kei, et al.
Veröffentlicht: (2024)
von: Cheng, Ho Kei, et al.
Veröffentlicht: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
von: Zhang, Yixiao, et al.
Veröffentlicht: (2024)
von: Zhang, Yixiao, et al.
Veröffentlicht: (2024)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
von: Steinmetz, Christian J., et al.
Veröffentlicht: (2024)
von: Steinmetz, Christian J., et al.
Veröffentlicht: (2024)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
von: Wang, Xiaopeng, et al.
Veröffentlicht: (2024)
von: Wang, Xiaopeng, et al.
Veröffentlicht: (2024)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
von: Huang, Kuan-Po, et al.
Veröffentlicht: (2025)
von: Huang, Kuan-Po, et al.
Veröffentlicht: (2025)
GRAFX: An Open-Source Library for Audio Processing Graphs in PyTorch
von: Lee, Sungho, et al.
Veröffentlicht: (2024)
von: Lee, Sungho, et al.
Veröffentlicht: (2024)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
von: Marinoni, Christian, et al.
Veröffentlicht: (2025)
von: Marinoni, Christian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
von: Chen, Yuanhong, et al.
Veröffentlicht: (2025) -
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
von: Shimada, Kazuki, et al.
Veröffentlicht: (2024) -
Do Foundational Audio Encoders Understand Music Structure?
von: Toyama, Keisuke, et al.
Veröffentlicht: (2025) -
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
von: Yang, Shiqi, et al.
Veröffentlicht: (2024) -
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
von: Zhong, Zhi, et al.
Veröffentlicht: (2025)