'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Nagashima, Chihiro, Takahashi, Akira, Zhong, Zhi, Takahashi, Shusuke, Mitsufuji, Yuki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
por: Takahashi, Akira, et al.
Publicado: (2025)
por: Takahashi, Akira, et al.
Publicado: (2025)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
por: Zhong, Zhi, et al.
Publicado: (2025)
por: Zhong, Zhi, et al.
Publicado: (2025)
Do Foundational Audio Encoders Understand Music Structure?
por: Toyama, Keisuke, et al.
Publicado: (2025)
por: Toyama, Keisuke, et al.
Publicado: (2025)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
por: Takahashi, Akira, et al.
Publicado: (2026)
por: Takahashi, Akira, et al.
Publicado: (2026)
Zero- and Few-shot Sound Event Localization and Detection
por: Shimada, Kazuki, et al.
Publicado: (2023)
por: Shimada, Kazuki, et al.
Publicado: (2023)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
por: Tateishi, Kazuya, et al.
Publicado: (2026)
por: Tateishi, Kazuya, et al.
Publicado: (2026)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
por: Comunità, Marco, et al.
Publicado: (2024)
por: Comunità, Marco, et al.
Publicado: (2024)
The Whole Is Greater than the Sum of Its Parts: Improving Music Source Separation by Bridging Network
por: Sawata, Ryosuke, et al.
Publicado: (2023)
por: Sawata, Ryosuke, et al.
Publicado: (2023)
DiffRoll: Diffusion-based Generative Music Transcription with Unsupervised Pretraining Capability
por: Cheuk, Kin Wai, et al.
Publicado: (2022)
por: Cheuk, Kin Wai, et al.
Publicado: (2022)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
por: Shimada, Kazuki, et al.
Publicado: (2024)
por: Shimada, Kazuki, et al.
Publicado: (2024)
Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis
por: Cui, Shuyang, et al.
Publicado: (2026)
por: Cui, Shuyang, et al.
Publicado: (2026)
SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation
por: Saito, Koichi, et al.
Publicado: (2024)
por: Saito, Koichi, et al.
Publicado: (2024)
OpenMU: Your Swiss Army Knife for Music Understanding
por: Zhao, Mengjie, et al.
Publicado: (2024)
por: Zhao, Mengjie, et al.
Publicado: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023)
por: Hirano, Masato, et al.
Publicado: (2023)
Woosh: A Sound Effects Foundation Model
por: Hadjeres, Gaëtan, et al.
Publicado: (2026)
por: Hadjeres, Gaëtan, et al.
Publicado: (2026)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
por: Yang, Shiqi, et al.
Publicado: (2024)
por: Yang, Shiqi, et al.
Publicado: (2024)
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
por: Shi, Hao, et al.
Publicado: (2023)
por: Shi, Hao, et al.
Publicado: (2023)
FoleyBench: A Benchmark For Video-to-Audio Models
por: Dixit, Satvik, et al.
Publicado: (2025)
por: Dixit, Satvik, et al.
Publicado: (2025)
Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification
por: Shimada, Kazuki, et al.
Publicado: (2025)
por: Shimada, Kazuki, et al.
Publicado: (2025)
SoundReactor: Frame-level Online Video-to-Audio Generation
por: Saito, Koichi, et al.
Publicado: (2025)
por: Saito, Koichi, et al.
Publicado: (2025)
A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
por: Ishii, Masato, et al.
Publicado: (2024)
por: Ishii, Masato, et al.
Publicado: (2024)
The Sound Demixing Challenge 2023 $\unicode{x2013}$ Cinematic Demixing Track
por: Uhlich, Stefan, et al.
Publicado: (2023)
por: Uhlich, Stefan, et al.
Publicado: (2023)
Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP
por: Karchkhadze, Tornike, et al.
Publicado: (2026)
por: Karchkhadze, Tornike, et al.
Publicado: (2026)
Automatic Music Sample Identification with Multi-Track Contrastive Learning
por: Riou, Alain, et al.
Publicado: (2025)
por: Riou, Alain, et al.
Publicado: (2025)
MARS: Sound Generation via Multi-Channel Autoregression on Spectrograms
por: Ristori, Eleonora, et al.
Publicado: (2025)
por: Ristori, Eleonora, et al.
Publicado: (2025)
Formula-Supervised Sound Event Detection: Pre-Training Without Real Data
por: Shibata, Yuto, et al.
Publicado: (2025)
por: Shibata, Yuto, et al.
Publicado: (2025)
Environmental Sound Deepfake Detection Using Deep-Learning Framework
por: Pham, Lam, et al.
Publicado: (2026)
por: Pham, Lam, et al.
Publicado: (2026)
Pediatric Asthma Detection with Googles HeAR Model: An AI-Driven Respiratory Sound Classifier
por: Ehtesham, Abul, et al.
Publicado: (2025)
por: Ehtesham, Abul, et al.
Publicado: (2025)
The Ghost in the Keys: A Disklavier Demo for Human-AI Musical Co-Creativity
por: Bradshaw, Louis, et al.
Publicado: (2025)
por: Bradshaw, Louis, et al.
Publicado: (2025)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
por: Cai, Pengfei, et al.
Publicado: (2025)
por: Cai, Pengfei, et al.
Publicado: (2025)
Sound Scene Synthesis at the DCASE 2024 Challenge
por: Lagrange, Mathieu, et al.
Publicado: (2025)
por: Lagrange, Mathieu, et al.
Publicado: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
Attribution-by-design: Ensuring Inference-Time Provenance in Generative Music Systems
por: Morreale, Fabio, et al.
Publicado: (2025)
por: Morreale, Fabio, et al.
Publicado: (2025)
Towards Open World Sound Event Detection
por: Hai, P. H., et al.
Publicado: (2026)
por: Hai, P. H., et al.
Publicado: (2026)
One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization
por: Stylianou, Ioannis, et al.
Publicado: (2026)
por: Stylianou, Ioannis, et al.
Publicado: (2026)
TopSeg: A Multi-Scale Topological Framework for Data-Efficient Heart Sound Segmentation
por: Zhang, Peihong, et al.
Publicado: (2025)
por: Zhang, Peihong, et al.
Publicado: (2025)
Joint Learning of Emotions in Music and Generalized Sounds
por: Simonetta, Federico, et al.
Publicado: (2024)
por: Simonetta, Federico, et al.
Publicado: (2024)
SilentCipher: Deep Audio Watermarking
por: Singh, Mayank Kumar, et al.
Publicado: (2024)
por: Singh, Mayank Kumar, et al.
Publicado: (2024)
MARS-Sep: Multimodal-Aligned Reinforced Sound Separation
por: Zhang, Zihan, et al.
Publicado: (2025)
por: Zhang, Zihan, et al.
Publicado: (2025)
Ejemplares similares
-
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
por: Takahashi, Akira, et al.
Publicado: (2025) -
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
por: Zhong, Zhi, et al.
Publicado: (2025) -
Do Foundational Audio Encoders Understand Music Structure?
por: Toyama, Keisuke, et al.
Publicado: (2025) -
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
por: Takahashi, Akira, et al.
Publicado: (2026) -
Zero- and Few-shot Sound Event Localization and Detection
por: Shimada, Kazuki, et al.
Publicado: (2023)