Meta-learning-based percussion transcription and $t\bar{a}la$ identification from low-resource audio
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kodag, Rahul Bapusaheb, Arora, Vipul |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
$T\bar{a}laGen:$ A System for Automatic $T\bar{a}la$ Identification and Generation
par: Kodag, Rahul Bapusaheb, et autres
Publié: (2024)
par: Kodag, Rahul Bapusaheb, et autres
Publié: (2024)
Weakly Supervised Tabla Stroke Transcription via TI-SDRM: A Rhythm-Aware Lattice Rescoring Framework
par: Kodag, Rahul Bapusaheb, et autres
Publié: (2026)
par: Kodag, Rahul Bapusaheb, et autres
Publié: (2026)
SyncNet: correlating objective for time delay estimation in audio signals
par: Raina, Akshay, et autres
Publié: (2022)
par: Raina, Akshay, et autres
Publié: (2022)
AudioNet: Supervised Deep Hashing for Retrieval of Similar Audio Events
par: Dutta, Sagar, et autres
Publié: (2025)
par: Dutta, Sagar, et autres
Publié: (2025)
Interactive singing melody extraction based on active adaptation
par: Saxena, Kavya Ranjan, et autres
Publié: (2024)
par: Saxena, Kavya Ranjan, et autres
Publié: (2024)
Uncertainty Quantification in Melody Estimation using Histogram Representation
par: Saxena, Kavya Ranjan, et autres
Publié: (2025)
par: Saxena, Kavya Ranjan, et autres
Publié: (2025)
BEST-STD2.0: Balanced and Efficient Speech Tokenizer for Spoken Term Detection
par: Singh, Anup, et autres
Publié: (2025)
par: Singh, Anup, et autres
Publié: (2025)
Improving Active Learning for Melody Estimation by Disentangling Uncertainties
par: Jaiswal, Aayush, et autres
Publié: (2025)
par: Jaiswal, Aayush, et autres
Publié: (2025)
Online incremental learning for audio classification using a pretrained audio model
par: Mulimani, Manjunath, et autres
Publié: (2025)
par: Mulimani, Manjunath, et autres
Publié: (2025)
Explainable Deep Learning Analysis for Raga Identification in Indian Art Music
par: Singh, Parampreet, et autres
Publié: (2024)
par: Singh, Parampreet, et autres
Publié: (2024)
H-QuEST: Accelerating Query-by-Example Spoken Term Detection with Hierarchical Indexing
par: Singh, Akanksha, et autres
Publié: (2025)
par: Singh, Akanksha, et autres
Publié: (2025)
Identification and Clustering of Unseen Ragas in Indian Art Music
par: Singh, Parampreet, et autres
Publié: (2024)
par: Singh, Parampreet, et autres
Publié: (2024)
Attention-Based Audio Embeddings for Query-by-Example
par: Singh, Anup, et autres
Publié: (2022)
par: Singh, Anup, et autres
Publié: (2022)
Reconstructing the Charlie Parker Omnibook using an audio-to-score automatic transcription pipeline
par: Riley, Xavier, et autres
Publié: (2024)
par: Riley, Xavier, et autres
Publié: (2024)
Scaling up masked audio encoder learning for general audio classification
par: Dinkel, Heinrich, et autres
Publié: (2024)
par: Dinkel, Heinrich, et autres
Publié: (2024)
LDCodec: A high quality neural audio codec with low-complexity decoder
par: Jiang, Jiawei, et autres
Publié: (2025)
par: Jiang, Jiawei, et autres
Publié: (2025)
Deep learning based spatial aliasing reduction in beamforming for audio capture
par: Guzik, Mateusz, et autres
Publié: (2025)
par: Guzik, Mateusz, et autres
Publié: (2025)
Positive and negative sampling strategies for self-supervised learning on audio-video data
par: Wang, Shanshan, et autres
Publié: (2024)
par: Wang, Shanshan, et autres
Publié: (2024)
Efficient learning-based sound propagation for virtual and real-world audio processing applications
par: Ratnarajah, Anton Jeran
Publié: (2024)
par: Ratnarajah, Anton Jeran
Publié: (2024)
TeLeS: Temporal Lexeme Similarity Score to Estimate Confidence in End-to-End ASR
par: Ravi, Nagarathna, et autres
Publié: (2024)
par: Ravi, Nagarathna, et autres
Publié: (2024)
Learning from Limited Labels: Transductive Graph Label Propagation for Indian Music Analysis
par: Singh, Parampreet, et autres
Publié: (2026)
par: Singh, Parampreet, et autres
Publié: (2026)
Automatic Detection and Analysis of Singing Mistakes for Music Pedagogy
par: Kumar, Sumit, et autres
Publié: (2026)
par: Kumar, Sumit, et autres
Publié: (2026)
AxLSTMs: learning self-supervised audio representations with xLSTMs
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
Learning to Discover: A Generalized Framework for Raga Identification without Forgetting
par: Singh, Parampreet, et autres
Publié: (2026)
par: Singh, Parampreet, et autres
Publié: (2026)
Cryfish: On deep audio analysis with Large Language Models
par: Mitrofanov, Anton, et autres
Publié: (2025)
par: Mitrofanov, Anton, et autres
Publié: (2025)
WavLM model ensemble for audio deepfake detection
par: Combei, David, et autres
Publié: (2024)
par: Combei, David, et autres
Publié: (2024)
Multiple Hankel matrix rank minimization for audio inpainting
par: Záviška, Pavel, et autres
Publié: (2023)
par: Záviška, Pavel, et autres
Publié: (2023)
Multi-label audio classification with a noisy zero-shot teacher
par: Braun, Sebastian, et autres
Publié: (2024)
par: Braun, Sebastian, et autres
Publié: (2024)
WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
par: Yuksel, Goksenin, et autres
Publié: (2025)
par: Yuksel, Goksenin, et autres
Publié: (2025)
Transcribe, Align and Segment: Creating speech datasets for low-resource languages
par: Sereda, Taras
Publié: (2024)
par: Sereda, Taras
Publié: (2024)
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens
par: San, Nay, et autres
Publié: (2024)
par: San, Nay, et autres
Publié: (2024)
Visually grounded few-shot word learning in low-resource settings
par: Nortje, Leanne, et autres
Publié: (2023)
par: Nortje, Leanne, et autres
Publié: (2023)
SCORE: Scaling audio generation using Standardized COmposite REwards
par: Jung, Jaemin, et autres
Publié: (2025)
par: Jung, Jaemin, et autres
Publié: (2025)
Incremental learning for audio classification with Hebbian Deep Neural Networks
par: Casciotti, Riccardo, et autres
Publié: (2026)
par: Casciotti, Riccardo, et autres
Publié: (2026)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
par: Takano, Taisei, et autres
Publié: (2025)
par: Takano, Taisei, et autres
Publié: (2025)
BEST-STD: Bidirectional Mamba-Enhanced Speech Tokenization for Spoken Term Detection
par: Singh, Anup, et autres
Publié: (2024)
par: Singh, Anup, et autres
Publié: (2024)
Towards predicting binaural audio quality in listeners with normal and impaired hearing
par: Biberger, Thomas, et autres
Publié: (2025)
par: Biberger, Thomas, et autres
Publié: (2025)
Sound event detection with audio-text models and heterogeneous temporal annotations
par: Harju, Manu, et autres
Publié: (2025)
par: Harju, Manu, et autres
Publié: (2025)
Documents similaires
-
$T\bar{a}laGen:$ A System for Automatic $T\bar{a}la$ Identification and Generation
par: Kodag, Rahul Bapusaheb, et autres
Publié: (2024) -
Weakly Supervised Tabla Stroke Transcription via TI-SDRM: A Rhythm-Aware Lattice Rescoring Framework
par: Kodag, Rahul Bapusaheb, et autres
Publié: (2026) -
SyncNet: correlating objective for time delay estimation in audio signals
par: Raina, Akshay, et autres
Publié: (2022) -
AudioNet: Supervised Deep Hashing for Retrieval of Similar Audio Events
par: Dutta, Sagar, et autres
Publié: (2025) -
Interactive singing melody extraction based on active adaptation
par: Saxena, Kavya Ranjan, et autres
Publié: (2024)