WhaleNet: a Novel Deep Learning Architecture for Marine Mammals Vocalizations on Watkins Marine Mammal Sound Database
Fuente:
arXiv
Salvato in:
| Autori principali: | Licciardi, Alessandro, Carbone, Davide |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
The LuViRA Dataset: Synchronized Vision, Radio, and Audio Sensors for Indoor Localization
di: Yaman, Ilayda, et al.
Pubblicazione: (2023)
di: Yaman, Ilayda, et al.
Pubblicazione: (2023)
LuViRA Dataset Validation and Discussion: Comparing Vision, Radio, and Audio Sensors for Indoor Localization
di: Yaman, Ilayda, et al.
Pubblicazione: (2023)
di: Yaman, Ilayda, et al.
Pubblicazione: (2023)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
di: Shi, Runwu, et al.
Pubblicazione: (2024)
di: Shi, Runwu, et al.
Pubblicazione: (2024)
Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation
di: Berghi, Davide, et al.
Pubblicazione: (2025)
di: Berghi, Davide, et al.
Pubblicazione: (2025)
Open-Source Manually Annotated Vocal Tract Database for Automatic Segmentation from 3D MRI Using Deep Learning: Benchmarking 2D and 3D Convolutional and Transformer Networks
di: Erattakulangara, Subin, et al.
Pubblicazione: (2025)
di: Erattakulangara, Subin, et al.
Pubblicazione: (2025)
Live Vocal Extraction from K-pop Performances
di: Kim, Yujin, et al.
Pubblicazione: (2025)
di: Kim, Yujin, et al.
Pubblicazione: (2025)
Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
di: Maghsoudi, Maryam, et al.
Pubblicazione: (2026)
di: Maghsoudi, Maryam, et al.
Pubblicazione: (2026)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
Spectrogram-Based Detection of Auto-Tuned Vocals in Music Recordings
di: Gohari, Mahyar, et al.
Pubblicazione: (2024)
di: Gohari, Mahyar, et al.
Pubblicazione: (2024)
RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text
di: Chen, Jiaben, et al.
Pubblicazione: (2024)
di: Chen, Jiaben, et al.
Pubblicazione: (2024)
BRUDEX Database: Binaural Room Impulse Responses with Uniformly Distributed External Microphones
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
di: Liao, Yuan, et al.
Pubblicazione: (2025)
di: Liao, Yuan, et al.
Pubblicazione: (2025)
String Sound Synthesizer on GPU-accelerated Finite Difference Scheme
di: Lee, Jin Woo, et al.
Pubblicazione: (2023)
di: Lee, Jin Woo, et al.
Pubblicazione: (2023)
Training-Free Deepfake Voice Recognition by Leveraging Large-Scale Pre-Trained Models
di: Pianese, Alessandro, et al.
Pubblicazione: (2024)
di: Pianese, Alessandro, et al.
Pubblicazione: (2024)
Microphone Array Signal Processing and Deep Learning for Speech Enhancement
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier
di: Dumpis, Martynas, et al.
Pubblicazione: (2026)
di: Dumpis, Martynas, et al.
Pubblicazione: (2026)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
di: Liang, Yunming, et al.
Pubblicazione: (2025)
di: Liang, Yunming, et al.
Pubblicazione: (2025)
AADNet: An End-to-End Deep Learning Model for Auditory Attention Decoding
di: Nguyen, Nhan Duc Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Nhan Duc Thanh, et al.
Pubblicazione: (2024)
Soundscape Captioning using Sound Affective Quality Network and Large Language Model
di: Hou, Yuanbo, et al.
Pubblicazione: (2024)
di: Hou, Yuanbo, et al.
Pubblicazione: (2024)
Online Similarity-and-Independence-Aware Beamformer for Low-latency Target Sound Extraction
di: Hiroe, Atsuo
Pubblicazione: (2023)
di: Hiroe, Atsuo
Pubblicazione: (2023)
Large Language Model-based Nonnegative Matrix Factorization For Cardiorespiratory Sound Separation
di: Torabi, Yasaman, et al.
Pubblicazione: (2025)
di: Torabi, Yasaman, et al.
Pubblicazione: (2025)
Compression Robust Synthetic Speech Detection Using Patched Spectrogram Transformer
di: Yadav, Amit Kumar Singh, et al.
Pubblicazione: (2024)
di: Yadav, Amit Kumar Singh, et al.
Pubblicazione: (2024)
Blind Source Separation of Radar Signals in Time Domain Using Deep Learning
di: Hinderer, Sven
Pubblicazione: (2025)
di: Hinderer, Sven
Pubblicazione: (2025)
Optimal Scalogram for Computational Complexity Reduction in Acoustic Recognition Using Deep Learning
di: Phan, Dang Thoai, et al.
Pubblicazione: (2025)
di: Phan, Dang Thoai, et al.
Pubblicazione: (2025)
STNet: Prediction of Underwater Sound Speed Profiles with An Advanced Semi-Transformer Neural Network
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
SoundSpring: Loss-Resilient Audio Transceiver with Dual-Functional Masked Language Modeling
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
di: Yao, Shengshi, et al.
Pubblicazione: (2025)
Decomposing the Influence of Physical Acoustic Modeling on Neural Personal Sound Zone Rendering: An Ablation Study
di: Jiang, Hao, et al.
Pubblicazione: (2026)
di: Jiang, Hao, et al.
Pubblicazione: (2026)
Detecting Post-Stroke Aphasia Via Brain Responses to Speech in a Deep Learning Framework
di: De Clercq, Pieter, et al.
Pubblicazione: (2024)
di: De Clercq, Pieter, et al.
Pubblicazione: (2024)
ECHO: Environmental Sound Classification with Hierarchical Ontology-guided Semi-Supervised Learning
di: Gupta, Pranav, et al.
Pubblicazione: (2024)
di: Gupta, Pranav, et al.
Pubblicazione: (2024)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025)
di: Yang, Yujie, et al.
Pubblicazione: (2025)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
Generative Deep Learning and Signal Processing for Data Augmentation of Cardiac Auscultation Signals: Improving Model Robustness Using Synthetic Audio
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
di: Abbott, Leigh, et al.
Pubblicazione: (2024)
A Multimodal Data Fusion Attention-Empowered Generative Adversarial Network for Real Time 3D Underwater Sound Speed Field Construction
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
di: Sato, Hiroshi, et al.
Pubblicazione: (2024)
di: Sato, Hiroshi, et al.
Pubblicazione: (2024)
FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
di: Hao, Xiang, et al.
Pubblicazione: (2020)
di: Hao, Xiang, et al.
Pubblicazione: (2020)
Segmenting Collision Sound Sources in Egocentric Videos
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos
di: Chen, Changan, et al.
Pubblicazione: (2024)
di: Chen, Changan, et al.
Pubblicazione: (2024)
Multi-View Spectrogram Transformer for Respiratory Sound Classification
di: He, Wentao, et al.
Pubblicazione: (2023)
di: He, Wentao, et al.
Pubblicazione: (2023)
Deep learning classification system for coconut maturity levels based on acoustic signals
di: Caladcad, June Anne, et al.
Pubblicazione: (2024)
di: Caladcad, June Anne, et al.
Pubblicazione: (2024)
Documenti analoghi
-
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025) -
The LuViRA Dataset: Synchronized Vision, Radio, and Audio Sensors for Indoor Localization
di: Yaman, Ilayda, et al.
Pubblicazione: (2023) -
LuViRA Dataset Validation and Discussion: Comparing Vision, Radio, and Audio Sensors for Indoor Localization
di: Yaman, Ilayda, et al.
Pubblicazione: (2023) -
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
di: Shi, Runwu, et al.
Pubblicazione: (2024) -
Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation
di: Berghi, Davide, et al.
Pubblicazione: (2025)