Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zeyu, Xiang, Suncheng, Yu, Tong, Gao, Jingsheng, Ruan, Jiacheng, Hu, Yanping, Liu, Ting, Fu, Yuzhuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
Unraveling Complex Data Diversity in Underwater Acoustic Target Recognition through Convolution-based Mixture of Experts
di: Xie, Yuan, et al.
Pubblicazione: (2024)
di: Xie, Yuan, et al.
Pubblicazione: (2024)
UniSep: Universal Target Audio Separation with Language Models at Scale
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
AeroGPT: Leveraging Large-Scale Audio Model for Aero-Engine Bearing Fault Diagnosis
di: Liu, Jiale, et al.
Pubblicazione: (2025)
di: Liu, Jiale, et al.
Pubblicazione: (2025)
Descriptor:: Extended-Length Audio Dataset for Synthetic Voice Detection and Speaker Recognition (ELAD-SVDSR)
di: Vijaykumar, Rahul, et al.
Pubblicazione: (2025)
di: Vijaykumar, Rahul, et al.
Pubblicazione: (2025)
Underwater-Art: Expanding Information Perspectives With Text Templates For Underwater Acoustic Target Recognition
di: Xie, Yuan, et al.
Pubblicazione: (2023)
di: Xie, Yuan, et al.
Pubblicazione: (2023)
Neural Edge Histogram Descriptors for Underwater Acoustic Target Recognition
di: Agashe, Atharva, et al.
Pubblicazione: (2025)
di: Agashe, Atharva, et al.
Pubblicazione: (2025)
ARAUS: A Large-Scale Dataset and Baseline Models of Affective Responses to Augmented Urban Soundscapes
di: Ooi, Kenneth, et al.
Pubblicazione: (2022)
di: Ooi, Kenneth, et al.
Pubblicazione: (2022)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
ASPED: An Audio Dataset for Detecting Pedestrians
di: Seshadri, Pavan, et al.
Pubblicazione: (2023)
di: Seshadri, Pavan, et al.
Pubblicazione: (2023)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Perturbed Public Voices (P$^{2}$V): A Dataset for Robust Audio Deepfake Detection
di: Gao, Chongyang, et al.
Pubblicazione: (2025)
di: Gao, Chongyang, et al.
Pubblicazione: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
DENSE: Dynamic Embedding Causal Target Speech Extraction
di: Wang, Yiwen, et al.
Pubblicazione: (2024)
di: Wang, Yiwen, et al.
Pubblicazione: (2024)
Code Drift: Towards Idempotent Neural Audio Codecs
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
The Computation of Generalized Embeddings for Underwater Acoustic Target Recognition using Contrastive Learning
di: Hummel, Hilde I., et al.
Pubblicazione: (2025)
di: Hummel, Hilde I., et al.
Pubblicazione: (2025)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
di: Dang, Ting, et al.
Pubblicazione: (2025)
di: Dang, Ting, et al.
Pubblicazione: (2025)
Audio-Language Datasets of Scenes and Events: A Survey
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
di: Yang, Qingran, et al.
Pubblicazione: (2026)
di: Yang, Qingran, et al.
Pubblicazione: (2026)
SoundCollage: Automated Discovery of New Classes in Audio Datasets
di: Choi, Ryuhaerang, et al.
Pubblicazione: (2024)
di: Choi, Ryuhaerang, et al.
Pubblicazione: (2024)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
di: Zhao, Yan, et al.
Pubblicazione: (2022)
di: Zhao, Yan, et al.
Pubblicazione: (2022)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
di: Du, Jiawei, et al.
Pubblicazione: (2024)
di: Du, Jiawei, et al.
Pubblicazione: (2024)
Binamix -- A Python Library for Generating Binaural Audio Datasets
di: Barry, Dan, et al.
Pubblicazione: (2025)
di: Barry, Dan, et al.
Pubblicazione: (2025)
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025)
di: Garg, Ashi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
di: Huang, Mengcheng, et al.
Pubblicazione: (2026) -
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025) -
Unraveling Complex Data Diversity in Underwater Acoustic Target Recognition through Convolution-based Mixture of Experts
di: Xie, Yuan, et al.
Pubblicazione: (2024) -
UniSep: Universal Target Audio Separation with Language Models at Scale
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025) -
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025)