Prevailing Research Areas for Music AI in the Era of Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Megan, Modrzejewski, Mateusz, Sivaraman, Aswin, Herremans, Dorien |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music
di: Husain, Jaavid Aktar, et al.
Pubblicazione: (2026)
di: Husain, Jaavid Aktar, et al.
Pubblicazione: (2026)
SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning
di: Chopra, Anuradha, et al.
Pubblicazione: (2025)
di: Chopra, Anuradha, et al.
Pubblicazione: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
Quantum-Enhanced Analysis and Grading of Vocal Performance
di: Agarwal, Rohan
Pubblicazione: (2025)
di: Agarwal, Rohan
Pubblicazione: (2025)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
di: Mehta, Shivam, et al.
Pubblicazione: (2024)
di: Mehta, Shivam, et al.
Pubblicazione: (2024)
HELIX: Scaling Raw Audio Understanding with Hybrid Mamba-Attention Beyond the Quadratic Limit
di: Khushiyant, et al.
Pubblicazione: (2026)
di: Khushiyant, et al.
Pubblicazione: (2026)
SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
di: Melechovsky, Jan, et al.
Pubblicazione: (2025)
di: Melechovsky, Jan, et al.
Pubblicazione: (2025)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Adaptable Symbolic Music Infilling with MIDI-RWKV
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
Audio-based Kinship Verification Using Age Domain Conversion
di: Sun, Qiyang, et al.
Pubblicazione: (2024)
di: Sun, Qiyang, et al.
Pubblicazione: (2024)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
di: Aristorenas, Aris J.
Pubblicazione: (2024)
di: Aristorenas, Aris J.
Pubblicazione: (2024)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
di: He, Zhanhong, et al.
Pubblicazione: (2025)
di: He, Zhanhong, et al.
Pubblicazione: (2025)
M6(GPT)3: Generating Multitrack Modifiable Multi-Minute MIDI Music from Text using Genetic algorithms, Probabilistic methods and GPT Models in any Progression and Time Signature
di: Poćwiardowski, Jakub, et al.
Pubblicazione: (2024)
di: Poćwiardowski, Jakub, et al.
Pubblicazione: (2024)
Matcha-TTS: A fast TTS architecture with conditional flow matching
di: Mehta, Shivam, et al.
Pubblicazione: (2023)
di: Mehta, Shivam, et al.
Pubblicazione: (2023)
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
di: Liu, Yucheng, et al.
Pubblicazione: (2025)
di: Liu, Yucheng, et al.
Pubblicazione: (2025)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
di: Yi, Yungang, et al.
Pubblicazione: (2024)
di: Yi, Yungang, et al.
Pubblicazione: (2024)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
di: Andreyev, Allison
Pubblicazione: (2025)
di: Andreyev, Allison
Pubblicazione: (2025)
AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
di: Maben, Leander Melroy, et al.
Pubblicazione: (2025)
di: Maben, Leander Melroy, et al.
Pubblicazione: (2025)
Automatic Album Sequencing
di: Herrmann, Vincent, et al.
Pubblicazione: (2024)
di: Herrmann, Vincent, et al.
Pubblicazione: (2024)
Guitar Tone Morphing by Diffusion-based Model
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Bloodroot: When Watermarking Turns Poisonous For Stealthy Backdoor
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Window Size Versus Accuracy Experiments in Voice Activity Detectors
di: McKinnon, Max, et al.
Pubblicazione: (2026)
di: McKinnon, Max, et al.
Pubblicazione: (2026)
Generation of Musical Timbres using a Text-Guided Diffusion Model
di: Yuan, Weixuan, et al.
Pubblicazione: (2025)
di: Yuan, Weixuan, et al.
Pubblicazione: (2025)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
Hidden Echoes Survive Training in Audio To Audio Generative Instrument Models
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
Graph Connectionist Temporal Classification for Phoneme Recognition
di: Grafé, Henry, et al.
Pubblicazione: (2025)
di: Grafé, Henry, et al.
Pubblicazione: (2025)
Named entity recognition for Serbian legal documents: Design, methodology and dataset development
di: Kalušev, Vladimir, et al.
Pubblicazione: (2025)
di: Kalušev, Vladimir, et al.
Pubblicazione: (2025)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
di: Opria, Joshua
Pubblicazione: (2026)
di: Opria, Joshua
Pubblicazione: (2026)
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
di: Cui, Hanfang, et al.
Pubblicazione: (2025)
di: Cui, Hanfang, et al.
Pubblicazione: (2025)
Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
di: Richter-Powell, Jessie, et al.
Pubblicazione: (2025)
di: Richter-Powell, Jessie, et al.
Pubblicazione: (2025)
The OCON model: an old but gold solution for distributable supervised classification
di: Giacomelli, Stefano, et al.
Pubblicazione: (2024)
di: Giacomelli, Stefano, et al.
Pubblicazione: (2024)
The OCON model: an old but green solution for distributable supervised classification for acoustic monitoring in smart cities
di: Giacomelli, Stefano, et al.
Pubblicazione: (2024)
di: Giacomelli, Stefano, et al.
Pubblicazione: (2024)
Developing Acoustic Models for Automatic Speech Recognition in Swedish
di: Salvi, Giampiero
Pubblicazione: (2024)
di: Salvi, Giampiero
Pubblicazione: (2024)
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
di: Wu, Junyan, et al.
Pubblicazione: (2024)
di: Wu, Junyan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music
di: Husain, Jaavid Aktar, et al.
Pubblicazione: (2026) -
SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning
di: Chopra, Anuradha, et al.
Pubblicazione: (2025) -
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
di: Mehta, Shivam, et al.
Pubblicazione: (2025) -
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
di: Mehta, Shivam, et al.
Pubblicazione: (2025) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)