AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yulin, Xu, Qisheng, Su, Yi, Zhu, Qian, Dou, Yong, Liu, Xinwang, Xu, Kele |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AudioSet-EV: an AudioSet-derived distribution of Emergency Vehicle Siren sounds
di: Giacomelli, Stefano, et al.
Pubblicazione: (2025)
di: Giacomelli, Stefano, et al.
Pubblicazione: (2025)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Hierarchical Label Propagation: A Model-Size-Dependent Performance Booster for AudioSet Tagging
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
di: Deng, Xuyao, et al.
Pubblicazione: (2025)
di: Deng, Xuyao, et al.
Pubblicazione: (2025)
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
di: Xu, David
Pubblicazione: (2024)
di: Xu, David
Pubblicazione: (2024)
Reject Threshold Adaptation for Open-Set Model Attribution of Deepfake Audio
di: Yan, Xinrui, et al.
Pubblicazione: (2024)
di: Yan, Xinrui, et al.
Pubblicazione: (2024)
Contrastive Learning-based Chaining-Cluster for Multilingual Voice-Face Association
di: Chen, Wuyang, et al.
Pubblicazione: (2024)
di: Chen, Wuyang, et al.
Pubblicazione: (2024)
Open-Set Source Tracing of Audio Deepfake Systems
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
di: Klein, Nicholas, et al.
Pubblicazione: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
di: Tao, Ye, et al.
Pubblicazione: (2025)
di: Tao, Ye, et al.
Pubblicazione: (2025)
MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations
di: Guo, Wenxiang, et al.
Pubblicazione: (2025)
di: Guo, Wenxiang, et al.
Pubblicazione: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Generalizable Audio Deepfake Detection via Latent Space Refinement and Augmentation
di: Huang, Wen, et al.
Pubblicazione: (2025)
di: Huang, Wen, et al.
Pubblicazione: (2025)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
di: Xiao, Yixuan, et al.
Pubblicazione: (2026)
di: Xiao, Yixuan, et al.
Pubblicazione: (2026)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs
di: Lee, Taehan, et al.
Pubblicazione: (2026)
di: Lee, Taehan, et al.
Pubblicazione: (2026)
Class-Incremental Learning for Multi-Label Audio Classification
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024)
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024)
HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing
di: Xu, Xuenan, et al.
Pubblicazione: (2026)
di: Xu, Xuenan, et al.
Pubblicazione: (2026)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
di: Zhao, Tong, et al.
Pubblicazione: (2026)
di: Zhao, Tong, et al.
Pubblicazione: (2026)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
di: Bi, Chunhao, et al.
Pubblicazione: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
Region-Specific Audio Tagging for Spatial Sound
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR
di: Magoshi, Ryo, et al.
Pubblicazione: (2026)
di: Magoshi, Ryo, et al.
Pubblicazione: (2026)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024)
di: Li, Chenxing, et al.
Pubblicazione: (2024)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
di: Xu, Xuenan, et al.
Pubblicazione: (2025)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
di: Guo, Hongming, et al.
Pubblicazione: (2024)
di: Guo, Hongming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AudioSet-EV: an AudioSet-derived distribution of Emergency Vehicle Siren sounds
di: Giacomelli, Stefano, et al.
Pubblicazione: (2025) -
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023) -
Hierarchical Label Propagation: A Model-Size-Dependent Performance Booster for AudioSet Tagging
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025) -
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025) -
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
di: Xu, Qisheng, et al.
Pubblicazione: (2024)