Audio-Language Datasets of Scenes and Events: A Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Wijngaard, Gijs, Formisano, Elia, Esposito, Michele, Dumontier, Michel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
Data-Balanced Curriculum Learning for Audio Question Answering
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
por: Wijngaard, Gijs, et al.
Publicado: (2024)
por: Wijngaard, Gijs, et al.
Publicado: (2024)
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
AudioScene: Integrating Object-Event Audio into 3D Scenes
por: Yuan, Shuaihang, et al.
Publicado: (2025)
por: Yuan, Shuaihang, et al.
Publicado: (2025)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
por: Müller, Nicolas M., et al.
Publicado: (2024)
por: Müller, Nicolas M., et al.
Publicado: (2024)
Unified Audio Event Detection
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
por: Xu, Qisheng, et al.
Publicado: (2024)
por: Xu, Qisheng, et al.
Publicado: (2024)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
por: Yi, Jiangyan, et al.
Publicado: (2022)
por: Yi, Jiangyan, et al.
Publicado: (2022)
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025)
por: Feng, Linfeng, et al.
Publicado: (2025)
ASPED: An Audio Dataset for Detecting Pedestrians
por: Seshadri, Pavan, et al.
Publicado: (2023)
por: Seshadri, Pavan, et al.
Publicado: (2023)
ASAudio: A Survey of Advanced Spatial Audio Research
por: Zhu, Zhiyuan, et al.
Publicado: (2025)
por: Zhu, Zhiyuan, et al.
Publicado: (2025)
Binamix -- A Python Library for Generating Binaural Audio Datasets
por: Barry, Dan, et al.
Publicado: (2025)
por: Barry, Dan, et al.
Publicado: (2025)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
Effective Pre-Training of Audio Transformers for Sound Event Detection
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
por: Xie, Zeyu, et al.
Publicado: (2023)
por: Xie, Zeyu, et al.
Publicado: (2023)
SALT: Standardized Audio event Label Taxonomy
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
por: Delgado, Pablo M., et al.
Publicado: (2025)
por: Delgado, Pablo M., et al.
Publicado: (2025)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2024)
por: Cai, Yiqiang, et al.
Publicado: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
por: Imoto, Keisuke
Publicado: (2025)
por: Imoto, Keisuke
Publicado: (2025)
SoundCollage: Automated Discovery of New Classes in Audio Datasets
por: Choi, Ryuhaerang, et al.
Publicado: (2024)
por: Choi, Ryuhaerang, et al.
Publicado: (2024)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
por: Du, Jiawei, et al.
Publicado: (2024)
por: Du, Jiawei, et al.
Publicado: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
por: Xiao, Feiyang, et al.
Publicado: (2024)
por: Xiao, Feiyang, et al.
Publicado: (2024)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
por: Zhao, Yan, et al.
Publicado: (2022)
por: Zhao, Yan, et al.
Publicado: (2022)
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
por: Poole, Katarina C., et al.
Publicado: (2025)
por: Poole, Katarina C., et al.
Publicado: (2025)
Continuous Audio Language Models
por: Rouard, Simon, et al.
Publicado: (2025)
por: Rouard, Simon, et al.
Publicado: (2025)
Exploring Differences between Human Perception and Model Inference in Audio Event Recognition
por: Tan, Yizhou, et al.
Publicado: (2024)
por: Tan, Yizhou, et al.
Publicado: (2024)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
por: Roman, Adrian S., et al.
Publicado: (2025)
por: Roman, Adrian S., et al.
Publicado: (2025)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
por: Yang, Xiaoyu, et al.
Publicado: (2024)
por: Yang, Xiaoyu, et al.
Publicado: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
por: Salganik, Rebecca, et al.
Publicado: (2026)
por: Salganik, Rebecca, et al.
Publicado: (2026)
Ejemplares similares
-
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
por: Wijngaard, Gijs, et al.
Publicado: (2025) -
Data-Balanced Curriculum Learning for Audio Question Answering
por: Wijngaard, Gijs, et al.
Publicado: (2025) -
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
por: Wijngaard, Gijs, et al.
Publicado: (2024) -
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025) -
AudioScene: Integrating Object-Event Audio into 3D Scenes
por: Yuan, Shuaihang, et al.
Publicado: (2025)