No Free Lunch from Audio Pretraining in Bioacoustics: A Benchmark Study of Embeddings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Chenggang, Yang, Zhiyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
par: Rauch, Lukas, et autres
Publié: (2024)
par: Rauch, Lukas, et autres
Publié: (2024)
State Space Models for Bioacoustics: A Comparative Evaluation with Transformers
par: Tang, Chengyu, et autres
Publié: (2025)
par: Tang, Chengyu, et autres
Publié: (2025)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
par: Robinson, David, et autres
Publié: (2024)
par: Robinson, David, et autres
Publié: (2024)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
par: Grötschla, Florian, et autres
Publié: (2024)
par: Grötschla, Florian, et autres
Publié: (2024)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
MAEB: Massive Audio Embedding Benchmark
par: Assadi, Adnan El, et autres
Publié: (2026)
par: Assadi, Adnan El, et autres
Publié: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
Towards Deep Active Learning in Avian Bioacoustics
par: Rauch, Lukas, et autres
Publié: (2024)
par: Rauch, Lukas, et autres
Publié: (2024)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
par: Mei, Xinhao, et autres
Publié: (2026)
par: Mei, Xinhao, et autres
Publié: (2026)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
par: Zhang, Qian, et autres
Publié: (2026)
par: Zhang, Qian, et autres
Publié: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
par: Marincione, Davide, et autres
Publié: (2025)
par: Marincione, Davide, et autres
Publié: (2025)
Smart Passive Acoustic Monitoring: Embedding a Classifier on AudioMoth Microcontroller
par: Lerbourg, Louis, et autres
Publié: (2026)
par: Lerbourg, Louis, et autres
Publié: (2026)
MOSS-Audio Technical Report
par: Yang, Chen, et autres
Publié: (2026)
par: Yang, Chen, et autres
Publié: (2026)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
par: Iyer, Laya, et autres
Publié: (2026)
par: Iyer, Laya, et autres
Publié: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
par: Li, Yanda, et autres
Publié: (2026)
par: Li, Yanda, et autres
Publié: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2024)
par: Yang, Wanqi, et autres
Publié: (2024)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
par: Li, Xiquan, et autres
Publié: (2025)
par: Li, Xiquan, et autres
Publié: (2025)
Toward Noise-Aware Audio Deepfake Detection: Survey, SNR-Benchmarks, and Practical Recipes
par: Sen, Udayon, et autres
Publié: (2025)
par: Sen, Udayon, et autres
Publié: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
par: Wang, Junyou, et autres
Publié: (2025)
par: Wang, Junyou, et autres
Publié: (2025)
Pretrained Conformers for Audio Fingerprinting and Retrieval
par: Altwlkany, Kemal, et autres
Publié: (2025)
par: Altwlkany, Kemal, et autres
Publié: (2025)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
par: Kang, Mintong, et autres
Publié: (2026)
par: Kang, Mintong, et autres
Publié: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
par: Chen, Yen-Shan, et autres
Publié: (2026)
par: Chen, Yen-Shan, et autres
Publié: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
par: Zhang, Dan, et autres
Publié: (2026)
par: Zhang, Dan, et autres
Publié: (2026)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
par: Xie, Xinyuan, et autres
Publié: (2026)
par: Xie, Xinyuan, et autres
Publié: (2026)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
par: Chen, Yukun, et autres
Publié: (2026)
par: Chen, Yukun, et autres
Publié: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
par: Sun, Zhe, et autres
Publié: (2025)
par: Sun, Zhe, et autres
Publié: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
Comparative Study of State-based Neural Networks for Virtual Analog Audio Effects Modeling
par: Simionato, Riccardo, et autres
Publié: (2024)
par: Simionato, Riccardo, et autres
Publié: (2024)
Embedding Alignment in Code Generation for Audio
par: Kouteili, Sam, et autres
Publié: (2025)
par: Kouteili, Sam, et autres
Publié: (2025)
Documents similaires
-
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
par: Rauch, Lukas, et autres
Publié: (2024) -
State Space Models for Bioacoustics: A Comparative Evaluation with Transformers
par: Tang, Chengyu, et autres
Publié: (2025) -
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
par: Robinson, David, et autres
Publié: (2024) -
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
par: Grötschla, Florian, et autres
Publié: (2024) -
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)