A Multimodal Symphony: Integrating Taste and Sound through Generative AI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Spanio, Matteo, Zampini, Massimiliano, Rodà, Antonio, Pierucci, Franco |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
par: Spanio, Matteo, et autres
Publié: (2026)
par: Spanio, Matteo, et autres
Publié: (2026)
Adaptable Symbolic Music Infilling with MIDI-RWKV
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026)
par: Niizumi, Daisuke, et autres
Publié: (2026)
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
par: Dhiman, Jai
Publié: (2026)
par: Dhiman, Jai
Publié: (2026)
TorchFX: A modern approach to Audio DSP with PyTorch and GPU acceleration
par: Spanio, Matteo, et autres
Publié: (2025)
par: Spanio, Matteo, et autres
Publié: (2025)
Hidden Echoes Survive Training in Audio To Audio Generative Instrument Models
par: Tralie, Christopher J., et autres
Publié: (2024)
par: Tralie, Christopher J., et autres
Publié: (2024)
Automatic Album Sequencing
par: Herrmann, Vincent, et autres
Publié: (2024)
par: Herrmann, Vincent, et autres
Publié: (2024)
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
par: de Brito, Daniel Oliveira, et autres
Publié: (2025)
par: de Brito, Daniel Oliveira, et autres
Publié: (2025)
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
par: Poltronieri, Andrea, et autres
Publié: (2024)
par: Poltronieri, Andrea, et autres
Publié: (2024)
Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
par: Richter-Powell, Jessie, et autres
Publié: (2025)
par: Richter-Powell, Jessie, et autres
Publié: (2025)
Quantum-Enhanced Analysis and Grading of Vocal Performance
par: Agarwal, Rohan
Publié: (2025)
par: Agarwal, Rohan
Publié: (2025)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification
par: Li, Haowen, et autres
Publié: (2025)
par: Li, Haowen, et autres
Publié: (2025)
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
par: Liu, Yucheng, et autres
Publié: (2025)
par: Liu, Yucheng, et autres
Publié: (2025)
GraFPrint: A GNN-Based Approach for Audio Identification
par: Bhattacharjee, Aditya, et autres
Publié: (2024)
par: Bhattacharjee, Aditya, et autres
Publié: (2024)
A State-of-the-Art Review on Acoustic Preservation of Historical Worship Spaces through Auralization
par: Rosseel, Hannes, et autres
Publié: (2025)
par: Rosseel, Hannes, et autres
Publié: (2025)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
par: Aristorenas, Aris J.
Publié: (2024)
par: Aristorenas, Aris J.
Publié: (2024)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
par: He, Zhanhong, et autres
Publié: (2025)
par: He, Zhanhong, et autres
Publié: (2025)
Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback
par: Jahanbin, Peyman
Publié: (2025)
par: Jahanbin, Peyman
Publié: (2025)
The Concatenator: A Bayesian Approach To Real Time Concatenative Musaicing
par: Tralie, Christopher, et autres
Publié: (2024)
par: Tralie, Christopher, et autres
Publié: (2024)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Audio-based Kinship Verification Using Age Domain Conversion
par: Sun, Qiyang, et autres
Publié: (2024)
par: Sun, Qiyang, et autres
Publié: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
par: Yi, Yungang, et autres
Publié: (2024)
par: Yi, Yungang, et autres
Publié: (2024)
TuneGenie: Reasoning-based LLM agents for preferential music generation
par: Pandey, Amitesh, et autres
Publié: (2025)
par: Pandey, Amitesh, et autres
Publié: (2025)
KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods
par: Nzeyimana, Antoine
Publié: (2023)
par: Nzeyimana, Antoine
Publié: (2023)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
par: Chen, Gehui, et autres
Publié: (2024)
par: Chen, Gehui, et autres
Publié: (2024)
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
Noise-Robust Keyword Spotting through Self-supervised Pretraining
par: Mørk, Jacob, et autres
Publié: (2024)
par: Mørk, Jacob, et autres
Publié: (2024)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
par: Bovbjerg, Holger Severin, et autres
Publié: (2025)
par: Bovbjerg, Holger Severin, et autres
Publié: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
Experimental Study: Enhancing Voice Spoofing Detection Models with wav2vec 2.0
par: Kang, Taein, et autres
Publié: (2024)
par: Kang, Taein, et autres
Publié: (2024)
A Baseline Multimodal Approach to Emotion Recognition in Conversations
par: Yeste, Víctor, et autres
Publié: (2026)
par: Yeste, Víctor, et autres
Publié: (2026)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
Personality-Enhanced Multimodal Depression Detection in the Elderly
par: Wang, Honghong, et autres
Publié: (2025)
par: Wang, Honghong, et autres
Publié: (2025)
Documents similaires
-
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
par: Spanio, Matteo, et autres
Publié: (2026) -
Adaptable Symbolic Music Infilling with MIDI-RWKV
par: Zhou-Zheng, Christian, et autres
Publié: (2025) -
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026) -
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
par: Dhiman, Jai
Publié: (2026) -
TorchFX: A modern approach to Audio DSP with PyTorch and GPU acceleration
par: Spanio, Matteo, et autres
Publié: (2025)