SoundPlot: An Open-Source Framework for Birdsong Acoustic Analysis and Neural Synthesis with Interactive 3D Visualization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mehdi, Naqcho Ali, Adeel, Mohammad, Larik, Aizaz Ali |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Neural Proxies for Sound Synthesizers: Learning Perceptually Informed Preset Representations
par: Combes, Paolo, et autres
Publié: (2025)
par: Combes, Paolo, et autres
Publié: (2025)
Quantum-Enhanced Analysis and Grading of Vocal Performance
par: Agarwal, Rohan
Publié: (2025)
par: Agarwal, Rohan
Publié: (2025)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
par: Aristorenas, Aris J.
Publié: (2024)
par: Aristorenas, Aris J.
Publié: (2024)
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
par: Cui, Hanfang, et autres
Publié: (2025)
par: Cui, Hanfang, et autres
Publié: (2025)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
par: He, Zhanhong, et autres
Publié: (2025)
par: He, Zhanhong, et autres
Publié: (2025)
Crossing the Species Divide: Transfer Learning from Speech to Animal Sounds
par: Cauzinille, Jules, et autres
Publié: (2025)
par: Cauzinille, Jules, et autres
Publié: (2025)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
par: Kim, Minu, et autres
Publié: (2025)
par: Kim, Minu, et autres
Publié: (2025)
Representing Classical Compositions through Implication-Realization Temporal-Gestalt Graphs
par: Bomediano, A. V., et autres
Publié: (2025)
par: Bomediano, A. V., et autres
Publié: (2025)
The evolution of inharmonicity and noisiness in contemporary popular music
par: Deruty, Emmanuel, et autres
Publié: (2024)
par: Deruty, Emmanuel, et autres
Publié: (2024)
MuQ-Eval: An Open-Source Per-Sample Quality Metric for AI Music Generation Evaluation
par: Zhu, Di, et autres
Publié: (2026)
par: Zhu, Di, et autres
Publié: (2026)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
par: Opria, Joshua
Publié: (2026)
par: Opria, Joshua
Publié: (2026)
PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR
par: Xu, Tianyu, et autres
Publié: (2026)
par: Xu, Tianyu, et autres
Publié: (2026)
Masked Contrastive Pre-Training Improves Music Audio Key Detection
par: Yonay, Ori, et autres
Publié: (2026)
par: Yonay, Ori, et autres
Publié: (2026)
HELIX: Scaling Raw Audio Understanding with Hybrid Mamba-Attention Beyond the Quadratic Limit
par: Khushiyant, et autres
Publié: (2026)
par: Khushiyant, et autres
Publié: (2026)
Understanding the Algorithm Behind Audio Key Detection
par: Silva, Henrique Perez G.
Publié: (2025)
par: Silva, Henrique Perez G.
Publié: (2025)
Distilled HuBERT for Mobile Speech Emotion Recognition: A Cross-Corpus Validation Study
par: Ismail, Saifelden M.
Publié: (2025)
par: Ismail, Saifelden M.
Publié: (2025)
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps
par: Qian, Lekai, et autres
Publié: (2026)
par: Qian, Lekai, et autres
Publié: (2026)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
par: Chen, Kuan-Yu, et autres
Publié: (2026)
par: Chen, Kuan-Yu, et autres
Publié: (2026)
acoupi: An Open-Source Python Framework for Deploying Bioacoustic AI Models on Edge Devices
par: Vuilliomenet, Aude, et autres
Publié: (2025)
par: Vuilliomenet, Aude, et autres
Publié: (2025)
Prevailing Research Areas for Music AI in the Era of Foundation Models
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
Benchmarking Sub-Genre Classification For Mainstage Dance Music
par: Shu, Hongzhi, et autres
Publié: (2024)
par: Shu, Hongzhi, et autres
Publié: (2024)
Generation of Musical Timbres using a Text-Guided Diffusion Model
par: Yuan, Weixuan, et autres
Publié: (2025)
par: Yuan, Weixuan, et autres
Publié: (2025)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
par: Li, Pengcheng, et autres
Publié: (2024)
par: Li, Pengcheng, et autres
Publié: (2024)
OBHS: An Optimized Block Huffman Scheme for Real-Time Audio Compression
par: Mahfi, Muntahi Safwan, et autres
Publié: (2025)
par: Mahfi, Muntahi Safwan, et autres
Publié: (2025)
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
par: Dhiman, Jai
Publié: (2026)
par: Dhiman, Jai
Publié: (2026)
Enhanced DareFightingICE Competitions: Sound Design and AI Competitions
par: Khan, Ibrahim, et autres
Publié: (2024)
par: Khan, Ibrahim, et autres
Publié: (2024)
APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music
par: Husain, Jaavid Aktar, et autres
Publié: (2026)
par: Husain, Jaavid Aktar, et autres
Publié: (2026)
Reciprocal Latent Fields for Precomputed Sound Propagation
par: Seuté, Hugo, et autres
Publié: (2026)
par: Seuté, Hugo, et autres
Publié: (2026)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
par: Donepudi, Dharma Teja
Publié: (2025)
par: Donepudi, Dharma Teja
Publié: (2025)
Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
par: Richter-Powell, Jessie, et autres
Publié: (2025)
par: Richter-Powell, Jessie, et autres
Publié: (2025)
Improving French Synthetic Speech Quality via SSML Prosody Control
par: Ouali, Nassima Ould, et autres
Publié: (2025)
par: Ouali, Nassima Ould, et autres
Publié: (2025)
Refining music sample identification with a self-supervised graph neural network
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
par: Bhattacharjee, Aditya, et autres
Publié: (2025)
NasoVoce: A Nose-Mounted Low-Audibility Speech Interface for Always-Available Speech Interaction
par: Rekimoto, Jun, et autres
Publié: (2026)
par: Rekimoto, Jun, et autres
Publié: (2026)
Sonify Anything: Towards Context-Aware Sonic Interactions in AR
par: Schütz, Laura, et autres
Publié: (2025)
par: Schütz, Laura, et autres
Publié: (2025)
Spatial Audio Rendering for Real-Time Speech Translation in Virtual Meetings
par: Geleta, Margarita, et autres
Publié: (2025)
par: Geleta, Margarita, et autres
Publié: (2025)
Enhancing XR Auditory Realism via Multimodal Scene-Aware Acoustic Rendering
par: Xu, Tianyu, et autres
Publié: (2025)
par: Xu, Tianyu, et autres
Publié: (2025)
Documents similaires
-
Neural Proxies for Sound Synthesizers: Learning Perceptually Informed Preset Representations
par: Combes, Paolo, et autres
Publié: (2025) -
Quantum-Enhanced Analysis and Grading of Vocal Performance
par: Agarwal, Rohan
Publié: (2025) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
par: Kim, Minu, et autres
Publié: (2025) -
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
par: Aristorenas, Aris J.
Publié: (2024) -
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
par: Cui, Hanfang, et autres
Publié: (2025)