Exploring Differences between Human Perception and Model Inference in Audio Event Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Yizhou, Wu, Yanru, Hou, Yuanbo, Xu, Xin, Bu, Hui, Li, Shengchen, Botteldooren, Dick, Plumbley, Mark D. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
por: Hou, Yuanbo, et al.
Publicado: (2024)
por: Hou, Yuanbo, et al.
Publicado: (2024)
Improving Acoustic Scene Classification with City Features
por: Cai, Yiqiang, et al.
Publicado: (2025)
por: Cai, Yiqiang, et al.
Publicado: (2025)
Soundscape Captioning using Sound Affective Quality Network and Large Language Model
por: Hou, Yuanbo, et al.
Publicado: (2024)
por: Hou, Yuanbo, et al.
Publicado: (2024)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
por: Bibbó, Gabriel, et al.
Publicado: (2024)
por: Bibbó, Gabriel, et al.
Publicado: (2024)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2024)
por: Cai, Yiqiang, et al.
Publicado: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
BioDCASE 2026 Challenge Baseline for Cross-Domain Mosquito Species Classification
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
A General Close-loop Predictive Coding Framework for Auditory Working Memory
por: Yuan, Zhongju, et al.
Publicado: (2025)
por: Yuan, Zhongju, et al.
Publicado: (2025)
Exploring the User Experience of AI-Assisted Sound Searching Systems for Creative Workflows
por: Liu, Haohe, et al.
Publicado: (2025)
por: Liu, Haohe, et al.
Publicado: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
por: Wang, Shuiyuan, et al.
Publicado: (2026)
por: Wang, Shuiyuan, et al.
Publicado: (2026)
Region-Specific Audio Tagging for Spatial Sound
por: Zhao, Jinzheng, et al.
Publicado: (2025)
por: Zhao, Jinzheng, et al.
Publicado: (2025)
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2023)
por: Hu, Jinbo, et al.
Publicado: (2023)
Robust Audio Tagging under Class-wise Supervision Unreliability
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
Learning Domain-Robust Bioacoustic Representations for Mosquito Species Classification with Contrastive Learning and Distribution Alignment
por: Hou, Yuanbo, et al.
Publicado: (2025)
por: Hou, Yuanbo, et al.
Publicado: (2025)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
por: Tailleur, Modan, et al.
Publicado: (2024)
por: Tailleur, Modan, et al.
Publicado: (2024)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
por: Atito, Sara, et al.
Publicado: (2022)
por: Atito, Sara, et al.
Publicado: (2022)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
por: Xue, Hongfei, et al.
Publicado: (2024)
por: Xue, Hongfei, et al.
Publicado: (2024)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
por: Delgado, Pablo M., et al.
Publicado: (2025)
por: Delgado, Pablo M., et al.
Publicado: (2025)
PSELDNets: Pre-trained Neural Networks on a Large-scale Synthetic Dataset for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2024)
por: Hu, Jinbo, et al.
Publicado: (2024)
TF-SepNet: An Efficient 1D Kernel Design in CNNs for Low-Complexity Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2023)
por: Cai, Yiqiang, et al.
Publicado: (2023)
Compressing Quaternion Convolutional Neural Networks for Audio Classification
por: Singh, Arshdeep, et al.
Publicado: (2025)
por: Singh, Arshdeep, et al.
Publicado: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
por: Burchett-Vass, Rhys, et al.
Publicado: (2024)
por: Burchett-Vass, Rhys, et al.
Publicado: (2024)
Unified Audio Event Detection
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
A decade of DCASE: Achievements, practices, evaluations and future challenges
por: Mesaros, Annamaria, et al.
Publicado: (2024)
por: Mesaros, Annamaria, et al.
Publicado: (2024)
FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)
por: Mei, Xinhao, et al.
Publicado: (2022)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
por: Zhao, Junqi, et al.
Publicado: (2024)
por: Zhao, Junqi, et al.
Publicado: (2024)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
por: Liu, Wuyang, et al.
Publicado: (2023)
por: Liu, Wuyang, et al.
Publicado: (2023)
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025)
por: Feng, Linfeng, et al.
Publicado: (2025)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
por: Liu, Haohe, et al.
Publicado: (2024)
por: Liu, Haohe, et al.
Publicado: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Audio-Language Datasets of Scenes and Events: A Survey
por: Wijngaard, Gijs, et al.
Publicado: (2024)
por: Wijngaard, Gijs, et al.
Publicado: (2024)
Ejemplares similares
-
Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context
por: Hou, Yuanbo, et al.
Publicado: (2026) -
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
por: Hou, Yuanbo, et al.
Publicado: (2024) -
Improving Acoustic Scene Classification with City Features
por: Cai, Yiqiang, et al.
Publicado: (2025) -
Soundscape Captioning using Sound Affective Quality Network and Large Language Model
por: Hou, Yuanbo, et al.
Publicado: (2024) -
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
por: Bibbó, Gabriel, et al.
Publicado: (2024)