Boundary Regression for Leitmotif Detection in Music Audio
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Sihun, Jeong, Dasaem |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pictures Of MIDI: Controlled Music Generation via Graphical Prompts for Image-Based Diffusion Inpainting
di: Hawley, Scott H.
Pubblicazione: (2024)
di: Hawley, Scott H.
Pubblicazione: (2024)
Deepfake audio as a data augmentation technique for training automatic speech to text transcription models
di: Ferreira, Alexandre R., et al.
Pubblicazione: (2023)
di: Ferreira, Alexandre R., et al.
Pubblicazione: (2023)
SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2025)
di: Nfissi, Alaa, et al.
Pubblicazione: (2025)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
SpecWav-Attack: Leveraging Spectrogram Resizing and Wav2Vec 2.0 for Attacking Anonymized Speech
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
Adaptable Symbolic Music Infilling with MIDI-RWKV
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
An Empirical Analysis of Speech Self-Supervised Learning at Multiple Resolutions
di: Clark, Theo, et al.
Pubblicazione: (2024)
di: Clark, Theo, et al.
Pubblicazione: (2024)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
di: Kuang, Sheng, et al.
Pubblicazione: (2022)
di: Kuang, Sheng, et al.
Pubblicazione: (2022)
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
di: Poltronieri, Andrea, et al.
Pubblicazione: (2024)
di: Poltronieri, Andrea, et al.
Pubblicazione: (2024)
Knowledge Distillation for Real-Time Classification of Early Media in Voice Communications
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
Developing Acoustic Models for Automatic Speech Recognition in Swedish
di: Salvi, Giampiero
Pubblicazione: (2024)
di: Salvi, Giampiero
Pubblicazione: (2024)
Segment Boundary Detection via Class Entropy Measurements in Connectionist Phoneme Recognition
di: Salvi, Giampiero
Pubblicazione: (2024)
di: Salvi, Giampiero
Pubblicazione: (2024)
Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
Iterative Feature Boosting for Explainable Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
NAAQA: A Neural Architecture for Acoustic Question Answering
di: Abdelnour, Jerome, et al.
Pubblicazione: (2021)
di: Abdelnour, Jerome, et al.
Pubblicazione: (2021)
Enhancing Audio Generation Diversity with Visual Information
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
UniTAF: A Modular Framework for Joint Text-to-Speech and Audio-to-Face Modeling
di: Zhou, Qiangong, et al.
Pubblicazione: (2026)
di: Zhou, Qiangong, et al.
Pubblicazione: (2026)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
di: Kozak, Nazar
Pubblicazione: (2026)
di: Kozak, Nazar
Pubblicazione: (2026)
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
FakeSound: Deepfake General Audio Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
Training for Speech Recognition on Coprocessors
di: Baunsgaard, Sebastian, et al.
Pubblicazione: (2020)
di: Baunsgaard, Sebastian, et al.
Pubblicazione: (2020)
Community-Informed AI Models for Police Accountability
di: Graham, Benjamin A. T., et al.
Pubblicazione: (2024)
di: Graham, Benjamin A. T., et al.
Pubblicazione: (2024)
KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods
di: Nzeyimana, Antoine
Pubblicazione: (2023)
di: Nzeyimana, Antoine
Pubblicazione: (2023)
Deep Hierarchical Knowledge Loss for Fault Intensity Diagnosis
di: Sha, Yu, et al.
Pubblicazione: (2026)
di: Sha, Yu, et al.
Pubblicazione: (2026)
Speaker-Independent Dysarthria Severity Classification using Self-Supervised Transformers and Multi-Task Learning
di: Stumpf, Lauren, et al.
Pubblicazione: (2024)
di: Stumpf, Lauren, et al.
Pubblicazione: (2024)
Dereverberation Using Binary Residual Masking with Time-Domain Consistency
di: Williams, Daniel G.
Pubblicazione: (2025)
di: Williams, Daniel G.
Pubblicazione: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
di: Marie, Ambre, et al.
Pubblicazione: (2025)
di: Marie, Ambre, et al.
Pubblicazione: (2025)
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024)
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
di: Gautam, Sushant, et al.
Pubblicazione: (2024)
di: Gautam, Sushant, et al.
Pubblicazione: (2024)
A Domain Knowledge Informed Approach for Anomaly Detection of Electric Vehicle Interior Sounds
di: Kunte, Deepti, et al.
Pubblicazione: (2025)
di: Kunte, Deepti, et al.
Pubblicazione: (2025)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
FabuLight-ASD: Unveiling Speech Activity via Body Language
di: Carneiro, Hugo, et al.
Pubblicazione: (2024)
di: Carneiro, Hugo, et al.
Pubblicazione: (2024)
Towards Training Music Taggers on Synthetic Data
di: Kroher, Nadine, et al.
Pubblicazione: (2024)
di: Kroher, Nadine, et al.
Pubblicazione: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Pictures Of MIDI: Controlled Music Generation via Graphical Prompts for Image-Based Diffusion Inpainting
di: Hawley, Scott H.
Pubblicazione: (2024) -
Deepfake audio as a data augmentation technique for training automatic speech to text transcription models
di: Ferreira, Alexandre R., et al.
Pubblicazione: (2023) -
SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2025) -
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026) -
SpecWav-Attack: Leveraging Spectrogram Resizing and Wav2Vec 2.0 for Attacking Anonymized Speech
di: Li, Yuqi, et al.
Pubblicazione: (2025)