Enregistré dans:
| Auteurs principaux: | Bhattacharjee, Aditya, Higgs, Ivan Meresman, Sandler, Mark, Benetos, Emmanouil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2506.14684 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GraFPrint: A GNN-Based Approach for Audio Identification
par: Bhattacharjee, Aditya, et autres
Publié: (2024)
par: Bhattacharjee, Aditya, et autres
Publié: (2024)
Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
MuQ-Eval: An Open-Source Per-Sample Quality Metric for AI Music Generation Evaluation
par: Zhu, Di, et autres
Publié: (2026)
par: Zhu, Di, et autres
Publié: (2026)
Quantum-Enhanced Analysis and Grading of Vocal Performance
par: Agarwal, Rohan
Publié: (2025)
par: Agarwal, Rohan
Publié: (2025)
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
par: Dhiman, Jai
Publié: (2026)
par: Dhiman, Jai
Publié: (2026)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
par: Aristorenas, Aris J.
Publié: (2024)
par: Aristorenas, Aris J.
Publié: (2024)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
par: He, Zhanhong, et autres
Publié: (2025)
par: He, Zhanhong, et autres
Publié: (2025)
Step-Audio-R1 Technical Report
par: Tian, Fei, et autres
Publié: (2025)
par: Tian, Fei, et autres
Publié: (2025)
Adaptable Symbolic Music Infilling with MIDI-RWKV
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
Crossing the Species Divide: Transfer Learning from Speech to Animal Sounds
par: Cauzinille, Jules, et autres
Publié: (2025)
par: Cauzinille, Jules, et autres
Publié: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
DFingerNet: Noise-Adaptive Speech Enhancement for Hearing Aids
par: Tsangko, Iosif, et autres
Publié: (2025)
par: Tsangko, Iosif, et autres
Publié: (2025)
Listen to the Unexpected: Self-Supervised Surprise Detection for Efficient Viewport Prediction
par: Khah, Arman Nik, et autres
Publié: (2026)
par: Khah, Arman Nik, et autres
Publié: (2026)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
par: Mehta, Shivam, et autres
Publié: (2024)
par: Mehta, Shivam, et autres
Publié: (2024)
Machine learning based animal emotion classification using audio signals
par: Slobodian, Mariia, et autres
Publié: (2025)
par: Slobodian, Mariia, et autres
Publié: (2025)
HELIX: Scaling Raw Audio Understanding with Hybrid Mamba-Attention Beyond the Quadratic Limit
par: Khushiyant, et autres
Publié: (2026)
par: Khushiyant, et autres
Publié: (2026)
BemaGANv2: Discriminator Combination Strategies for GAN-based Vocoders in Long-Term Audio Generation
par: Park, Taesoo, et autres
Publié: (2025)
par: Park, Taesoo, et autres
Publié: (2025)
Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
par: Richter-Powell, Jessie, et autres
Publié: (2025)
par: Richter-Powell, Jessie, et autres
Publié: (2025)
Matcha-TTS: A fast TTS architecture with conditional flow matching
par: Mehta, Shivam, et autres
Publié: (2023)
par: Mehta, Shivam, et autres
Publié: (2023)
BMdataset: A Musicologically Curated LilyPond Dataset
par: Spanio, Matteo, et autres
Publié: (2026)
par: Spanio, Matteo, et autres
Publié: (2026)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
Automatic Album Sequencing
par: Herrmann, Vincent, et autres
Publié: (2024)
par: Herrmann, Vincent, et autres
Publié: (2024)
APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music
par: Husain, Jaavid Aktar, et autres
Publié: (2026)
par: Husain, Jaavid Aktar, et autres
Publié: (2026)
Reciprocal Latent Fields for Precomputed Sound Propagation
par: Seuté, Hugo, et autres
Publié: (2026)
par: Seuté, Hugo, et autres
Publié: (2026)
Masked Contrastive Pre-Training Improves Music Audio Key Detection
par: Yonay, Ori, et autres
Publié: (2026)
par: Yonay, Ori, et autres
Publié: (2026)
SoundPlot: An Open-Source Framework for Birdsong Acoustic Analysis and Neural Synthesis with Interactive 3D Visualization
par: Mehdi, Naqcho Ali, et autres
Publié: (2026)
par: Mehdi, Naqcho Ali, et autres
Publié: (2026)
The evolution of inharmonicity and noisiness in contemporary popular music
par: Deruty, Emmanuel, et autres
Publié: (2024)
par: Deruty, Emmanuel, et autres
Publié: (2024)
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps
par: Qian, Lekai, et autres
Publié: (2026)
par: Qian, Lekai, et autres
Publié: (2026)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
par: Chen, Kuan-Yu, et autres
Publié: (2026)
par: Chen, Kuan-Yu, et autres
Publié: (2026)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback
par: Jahanbin, Peyman
Publié: (2025)
par: Jahanbin, Peyman
Publié: (2025)
A Survey on World Models Grounded in Acoustic Physical Information
par: Chen, Xiaoliang, et autres
Publié: (2025)
par: Chen, Xiaoliang, et autres
Publié: (2025)
Dichotic harmony for the musical practice
par: Madgazin, Vadim R.
Publié: (2010)
par: Madgazin, Vadim R.
Publié: (2010)
Benchmarking Sub-Genre Classification For Mainstage Dance Music
par: Shu, Hongzhi, et autres
Publié: (2024)
par: Shu, Hongzhi, et autres
Publié: (2024)
Generation of Musical Timbres using a Text-Guided Diffusion Model
par: Yuan, Weixuan, et autres
Publié: (2025)
par: Yuan, Weixuan, et autres
Publié: (2025)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024)
par: Li, Pengcheng, et autres
Publié: (2024)
Documents similaires
-
GraFPrint: A GNN-Based Approach for Audio Identification
par: Bhattacharjee, Aditya, et autres
Publié: (2024) -
Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation
par: Bhattacharjee, Aditya, et autres
Publié: (2025) -
PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
par: Vosoughi, Ali, et autres
Publié: (2025) -
MuQ-Eval: An Open-Source Per-Sample Quality Metric for AI Music Generation Evaluation
par: Zhu, Di, et autres
Publié: (2026) -
Quantum-Enhanced Analysis and Grading of Vocal Performance
par: Agarwal, Rohan
Publié: (2025)