Audio-based Kinship Verification Using Age Domain Conversion
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Qiyang, Akman, Alican, Jing, Xin, Milling, Manuel, Schuller, Björn W. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
di: Liu, Yucheng, et al.
Pubblicazione: (2025)
di: Liu, Yucheng, et al.
Pubblicazione: (2025)
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
Quantum-Enhanced Analysis and Grading of Vocal Performance
di: Agarwal, Rohan
Pubblicazione: (2025)
di: Agarwal, Rohan
Pubblicazione: (2025)
Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback
di: Jahanbin, Peyman
Pubblicazione: (2025)
di: Jahanbin, Peyman
Pubblicazione: (2025)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
di: Aristorenas, Aris J.
Pubblicazione: (2024)
di: Aristorenas, Aris J.
Pubblicazione: (2024)
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
HELIX: Scaling Raw Audio Understanding with Hybrid Mamba-Attention Beyond the Quadratic Limit
di: Khushiyant, et al.
Pubblicazione: (2026)
di: Khushiyant, et al.
Pubblicazione: (2026)
Prevailing Research Areas for Music AI in the Era of Foundation Models
di: Wei, Megan, et al.
Pubblicazione: (2024)
di: Wei, Megan, et al.
Pubblicazione: (2024)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
di: He, Zhanhong, et al.
Pubblicazione: (2025)
di: He, Zhanhong, et al.
Pubblicazione: (2025)
Audio Explanation Synthesis with Generative Foundation Models
di: Akman, Alican, et al.
Pubblicazione: (2024)
di: Akman, Alican, et al.
Pubblicazione: (2024)
Noise-Robust Keyword Spotting through Self-supervised Pretraining
di: Mørk, Jacob, et al.
Pubblicazione: (2024)
di: Mørk, Jacob, et al.
Pubblicazione: (2024)
Self-supervised Pretraining for Robust Personalized Voice Activity Detection in Adverse Conditions
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2023)
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2023)
Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
Symbolic Audio Classification via Modal Decision Tree Learning
di: Marzano, Enrico, et al.
Pubblicazione: (2025)
di: Marzano, Enrico, et al.
Pubblicazione: (2025)
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
di: Poltronieri, Andrea, et al.
Pubblicazione: (2024)
di: Poltronieri, Andrea, et al.
Pubblicazione: (2024)
Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification
di: Li, Haowen, et al.
Pubblicazione: (2025)
di: Li, Haowen, et al.
Pubblicazione: (2025)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Cross-Dialect Bird Species Recognition with Dialect-Calibrated Augmentation
di: Ding, Jiani, et al.
Pubblicazione: (2025)
di: Ding, Jiani, et al.
Pubblicazione: (2025)
Simultaneous source separation of unknown numbers of single-channel underwater acoustic signals based on deep neural networks with separator-decoder structure
di: Sun, Qinggang, et al.
Pubblicazione: (2022)
di: Sun, Qinggang, et al.
Pubblicazione: (2022)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
TuneGenie: Reasoning-based LLM agents for preferential music generation
di: Pandey, Amitesh, et al.
Pubblicazione: (2025)
di: Pandey, Amitesh, et al.
Pubblicazione: (2025)
KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods
di: Nzeyimana, Antoine
Pubblicazione: (2023)
di: Nzeyimana, Antoine
Pubblicazione: (2023)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
Local Diagnostics of Continuous Normalizing Flow for Out-of-Distribution Detection
di: Cao, Xinwei, et al.
Pubblicazione: (2026)
di: Cao, Xinwei, et al.
Pubblicazione: (2026)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
di: Mehta, Shivam, et al.
Pubblicazione: (2025)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
DFingerNet: Noise-Adaptive Speech Enhancement for Hearing Aids
di: Tsangko, Iosif, et al.
Pubblicazione: (2025)
di: Tsangko, Iosif, et al.
Pubblicazione: (2025)
Detection and Classification of Cetacean Echolocation Clicks using Image-based Object Detection Methods applied to Advanced Wavelet-based Transformations
di: Hauer, Christopher
Pubblicazione: (2026)
di: Hauer, Christopher
Pubblicazione: (2026)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
di: Kozak, Nazar
Pubblicazione: (2026)
di: Kozak, Nazar
Pubblicazione: (2026)
FakeSound: Deepfake General Audio Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
di: Mehta, Shivam, et al.
Pubblicazione: (2024)
di: Mehta, Shivam, et al.
Pubblicazione: (2024)
GraFPrint: A GNN-Based Approach for Audio Identification
di: Bhattacharjee, Aditya, et al.
Pubblicazione: (2024)
di: Bhattacharjee, Aditya, et al.
Pubblicazione: (2024)
Experimental Study: Enhancing Voice Spoofing Detection Models with wav2vec 2.0
di: Kang, Taein, et al.
Pubblicazione: (2024)
di: Kang, Taein, et al.
Pubblicazione: (2024)
Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation
di: Dhiman, Jai
Pubblicazione: (2026)
di: Dhiman, Jai
Pubblicazione: (2026)
Scalable Evaluation for Audio Identification via Synthetic Latent Fingerprint Generation
di: Bhattacharjee, Aditya, et al.
Pubblicazione: (2025)
di: Bhattacharjee, Aditya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
di: Liu, Yucheng, et al.
Pubblicazione: (2025) -
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025) -
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026) -
Quantum-Enhanced Analysis and Grading of Vocal Performance
di: Agarwal, Rohan
Pubblicazione: (2025) -
Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback
di: Jahanbin, Peyman
Pubblicazione: (2025)