Audio-Language Datasets of Scenes and Events: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Wijngaard, Gijs, Formisano, Elia, Esposito, Michele, Dumontier, Michel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
AudioToolAgent: An Agentic Framework for Audio-Language Models
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
AudioScene: Integrating Object-Event Audio into 3D Scenes
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
di: Müller, Nicolas M., et al.
Pubblicazione: (2024)
Unified Audio Event Detection
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
ASPED: An Audio Dataset for Detecting Pedestrians
di: Seshadri, Pavan, et al.
Pubblicazione: (2023)
di: Seshadri, Pavan, et al.
Pubblicazione: (2023)
ASAudio: A Survey of Advanced Spatial Audio Research
di: Zhu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhu, Zhiyuan, et al.
Pubblicazione: (2025)
Binamix -- A Python Library for Generating Binaural Audio Datasets
di: Barry, Dan, et al.
Pubblicazione: (2025)
di: Barry, Dan, et al.
Pubblicazione: (2025)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Effective Pre-Training of Audio Transformers for Sound Event Detection
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
SALT: Standardized Audio event Label Taxonomy
di: Stamatiadis, Paraskevas, et al.
Pubblicazione: (2024)
di: Stamatiadis, Paraskevas, et al.
Pubblicazione: (2024)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
di: Cai, Yiqiang, et al.
Pubblicazione: (2024)
di: Cai, Yiqiang, et al.
Pubblicazione: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
di: Imoto, Keisuke
Pubblicazione: (2025)
di: Imoto, Keisuke
Pubblicazione: (2025)
SoundCollage: Automated Discovery of New Classes in Audio Datasets
di: Choi, Ryuhaerang, et al.
Pubblicazione: (2024)
di: Choi, Ryuhaerang, et al.
Pubblicazione: (2024)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
di: Du, Jiawei, et al.
Pubblicazione: (2024)
di: Du, Jiawei, et al.
Pubblicazione: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
di: Zhao, Yan, et al.
Pubblicazione: (2022)
di: Zhao, Yan, et al.
Pubblicazione: (2022)
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Exploring Differences between Human Perception and Model Inference in Audio Event Recognition
di: Tan, Yizhou, et al.
Pubblicazione: (2024)
di: Tan, Yizhou, et al.
Pubblicazione: (2024)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
di: Roman, Adrian S., et al.
Pubblicazione: (2025)
di: Roman, Adrian S., et al.
Pubblicazione: (2025)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025) -
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025) -
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024) -
AudioToolAgent: An Agentic Framework for Audio-Language Models
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025) -
AudioScene: Integrating Object-Event Audio into 3D Scenes
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)