'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Nagashima, Chihiro, Takahashi, Akira, Zhong, Zhi, Takahashi, Shusuke, Mitsufuji, Yuki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
di: Takahashi, Akira, et al.
Pubblicazione: (2025)
di: Takahashi, Akira, et al.
Pubblicazione: (2025)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
di: Zhong, Zhi, et al.
Pubblicazione: (2025)
di: Zhong, Zhi, et al.
Pubblicazione: (2025)
Do Foundational Audio Encoders Understand Music Structure?
di: Toyama, Keisuke, et al.
Pubblicazione: (2025)
di: Toyama, Keisuke, et al.
Pubblicazione: (2025)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
di: Takahashi, Akira, et al.
Pubblicazione: (2026)
di: Takahashi, Akira, et al.
Pubblicazione: (2026)
Zero- and Few-shot Sound Event Localization and Detection
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
di: Tateishi, Kazuya, et al.
Pubblicazione: (2026)
di: Tateishi, Kazuya, et al.
Pubblicazione: (2026)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
di: Comunità, Marco, et al.
Pubblicazione: (2024)
di: Comunità, Marco, et al.
Pubblicazione: (2024)
The Whole Is Greater than the Sum of Its Parts: Improving Music Source Separation by Bridging Network
di: Sawata, Ryosuke, et al.
Pubblicazione: (2023)
di: Sawata, Ryosuke, et al.
Pubblicazione: (2023)
DiffRoll: Diffusion-based Generative Music Transcription with Unsupervised Pretraining Capability
di: Cheuk, Kin Wai, et al.
Pubblicazione: (2022)
di: Cheuk, Kin Wai, et al.
Pubblicazione: (2022)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis
di: Cui, Shuyang, et al.
Pubblicazione: (2026)
di: Cui, Shuyang, et al.
Pubblicazione: (2026)
SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation
di: Saito, Koichi, et al.
Pubblicazione: (2024)
di: Saito, Koichi, et al.
Pubblicazione: (2024)
OpenMU: Your Swiss Army Knife for Music Understanding
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
di: Hirano, Masato, et al.
Pubblicazione: (2023)
di: Hirano, Masato, et al.
Pubblicazione: (2023)
Woosh: A Sound Effects Foundation Model
di: Hadjeres, Gaëtan, et al.
Pubblicazione: (2026)
di: Hadjeres, Gaëtan, et al.
Pubblicazione: (2026)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
di: Nishigori, Shuichiro, et al.
Pubblicazione: (2025)
di: Nishigori, Shuichiro, et al.
Pubblicazione: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
di: Yang, Shiqi, et al.
Pubblicazione: (2024)
di: Yang, Shiqi, et al.
Pubblicazione: (2024)
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
di: Shi, Hao, et al.
Pubblicazione: (2023)
di: Shi, Hao, et al.
Pubblicazione: (2023)
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification
di: Shimada, Kazuki, et al.
Pubblicazione: (2025)
di: Shimada, Kazuki, et al.
Pubblicazione: (2025)
SoundReactor: Frame-level Online Video-to-Audio Generation
di: Saito, Koichi, et al.
Pubblicazione: (2025)
di: Saito, Koichi, et al.
Pubblicazione: (2025)
A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
di: Ishii, Masato, et al.
Pubblicazione: (2024)
di: Ishii, Masato, et al.
Pubblicazione: (2024)
The Sound Demixing Challenge 2023 $\unicode{x2013}$ Cinematic Demixing Track
di: Uhlich, Stefan, et al.
Pubblicazione: (2023)
di: Uhlich, Stefan, et al.
Pubblicazione: (2023)
Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2026)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2026)
Automatic Music Sample Identification with Multi-Track Contrastive Learning
di: Riou, Alain, et al.
Pubblicazione: (2025)
di: Riou, Alain, et al.
Pubblicazione: (2025)
MARS: Sound Generation via Multi-Channel Autoregression on Spectrograms
di: Ristori, Eleonora, et al.
Pubblicazione: (2025)
di: Ristori, Eleonora, et al.
Pubblicazione: (2025)
Formula-Supervised Sound Event Detection: Pre-Training Without Real Data
di: Shibata, Yuto, et al.
Pubblicazione: (2025)
di: Shibata, Yuto, et al.
Pubblicazione: (2025)
Environmental Sound Deepfake Detection Using Deep-Learning Framework
di: Pham, Lam, et al.
Pubblicazione: (2026)
di: Pham, Lam, et al.
Pubblicazione: (2026)
Pediatric Asthma Detection with Googles HeAR Model: An AI-Driven Respiratory Sound Classifier
di: Ehtesham, Abul, et al.
Pubblicazione: (2025)
di: Ehtesham, Abul, et al.
Pubblicazione: (2025)
The Ghost in the Keys: A Disklavier Demo for Human-AI Musical Co-Creativity
di: Bradshaw, Louis, et al.
Pubblicazione: (2025)
di: Bradshaw, Louis, et al.
Pubblicazione: (2025)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
di: Cai, Pengfei, et al.
Pubblicazione: (2025)
di: Cai, Pengfei, et al.
Pubblicazione: (2025)
Sound Scene Synthesis at the DCASE 2024 Challenge
di: Lagrange, Mathieu, et al.
Pubblicazione: (2025)
di: Lagrange, Mathieu, et al.
Pubblicazione: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
Attribution-by-design: Ensuring Inference-Time Provenance in Generative Music Systems
di: Morreale, Fabio, et al.
Pubblicazione: (2025)
di: Morreale, Fabio, et al.
Pubblicazione: (2025)
Towards Open World Sound Event Detection
di: Hai, P. H., et al.
Pubblicazione: (2026)
di: Hai, P. H., et al.
Pubblicazione: (2026)
One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization
di: Stylianou, Ioannis, et al.
Pubblicazione: (2026)
di: Stylianou, Ioannis, et al.
Pubblicazione: (2026)
TopSeg: A Multi-Scale Topological Framework for Data-Efficient Heart Sound Segmentation
di: Zhang, Peihong, et al.
Pubblicazione: (2025)
di: Zhang, Peihong, et al.
Pubblicazione: (2025)
Joint Learning of Emotions in Music and Generalized Sounds
di: Simonetta, Federico, et al.
Pubblicazione: (2024)
di: Simonetta, Federico, et al.
Pubblicazione: (2024)
SilentCipher: Deep Audio Watermarking
di: Singh, Mayank Kumar, et al.
Pubblicazione: (2024)
di: Singh, Mayank Kumar, et al.
Pubblicazione: (2024)
MARS-Sep: Multimodal-Aligned Reinforced Sound Separation
di: Zhang, Zihan, et al.
Pubblicazione: (2025)
di: Zhang, Zihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
di: Takahashi, Akira, et al.
Pubblicazione: (2025) -
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
di: Zhong, Zhi, et al.
Pubblicazione: (2025) -
Do Foundational Audio Encoders Understand Music Structure?
di: Toyama, Keisuke, et al.
Pubblicazione: (2025) -
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
di: Takahashi, Akira, et al.
Pubblicazione: (2026) -
Zero- and Few-shot Sound Event Localization and Detection
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)